Animación facial en tiempo real para Metahumans con Live Link Face en Unreal Engine 5

La transmisión de expresiones faciales en tiempo real a personajes digitales es un componente importante de los procesos modernos de animación y visualización. Con la aplicación Live Link Face de Epic Games y Unreal Engine 5, es posible transferir con precisión los movimientos faciales de una persona real a un personaje digital de Metahuman. Para ello se necesita un iPhone con cámara TrueDepth integrada, conectado a través de la red local al equipo donde se ejecuta Unreal Engine. En este tutorial se muestra cómo configurar la aplicación Live Link Face y conectarla con el motor, cómo preparar correctamente el Metahuman y cómo finalmente transmitir los datos faciales en vivo. El objetivo es establecer una conexión en tiempo real funcional, en la que el Metahuman se mueva de forma sincronizada con la mímica de la persona real. ...

Omniverse: Tutorial de Audio2Face

Audio2Face es una herramienta impulsada por IA dentro de NVIDIA Omniverse, diseñada específicamente para generar animaciones faciales realistas basadas únicamente en audio. Forma parte de la plataforma Omniverse, que ofrece un entorno de colaboración y simulación en tiempo real para flujos de trabajo en 3D. Audio2Face utiliza una red neuronal para convertir automáticamente el habla en expresiones faciales y movimientos vívidos. Normalmente se emplea Audio2Face para hacer hablar a personajes en juegos, películas o avatares digitales sin necesidad de animaciones de fotogramas clave complejas. Los movimientos generados pueden usarse directamente o transferirse a tus propios personajes 3D, lo que resulta especialmente interesante para producciones virtuales, gemelos digitales o aplicaciones interactivas. ...

Agente de eventos asistido por IA para eventos

En este proyecto he desarrollado un agente de IA, que analiza automáticamente eventos de la región NRW y los filtra según criterios personales. El objetivo era filtrar, de entre una gran cantidad de eventos, solo aquellos que realmente son relevantes – basado en un prompt definido individualmente. Esta imagen muestra la lista de más de 350 eventos que tienen lugar en un solo día en Düsseldorf. En todo NRW son varios miles de eventos en un día. ...

Los LLMs no son una panacea: prueba práctica de clasificación musical basada en metadatos

La cuestión era si los modelos de lenguaje de gran tamaño (LLMs) actuales como GPT-4 o DeepSeek eran capaces de clasificar automáticamente y de forma fiable piezas musicales – específicamente canciones de salsa – en “Salsa Cubana” o “Salsa Línea” basándose en el título, el artista, la letra y los metadatos. Se sabía que la información disponible (metadatos, etiquetas de género, letras) era incompleta y en parte inconsistente. La prueba tenía como objetivo explícito determinar los límites prácticos de los LLM actuales en este contexto. ...

Tutorial de Omniverse

¿Qué es Omniverse? Omniverse es una plataforma de NVIDIA con la que se pueden crear, conectar y simular mundos 3D virtuales – y todo en tiempo real. Omniverse es una plataforma abierta para desarrolladores, diseñadores, ingenieros, investigadores y creativos, para: Conectar aplicaciones 3D entre sí (p. ej. Blender, Maya, Unreal Engine) Colaborar en una única escena – en vivo y de forma simultánea. Crear simulaciones físicamente realistas y aplicaciones impulsadas por IA. ¿Para qué se utiliza Omniverse? Diseño, visualización y simulación de objetos como, por ejemplo, vehículos en tiempo real. Gemelos digitales de fábricas para optimizar procesos. Creación de assets y simulaciones visuales. Entrenamiento con datos sintéticos, p. ej. para vehículos autónomos. Colaboración en tiempo real al animar y renderizar. ¿Qué es USD? Omniverse se basa en el formato OpenUSD (Universal Scene Description) de Pixar – un formato de archivo que puede describir escenas 3D complejas. ...

Configurar localmente Wan 2.1 con ComfyUI con soporte GPU

ComfyUI es una interfaz gráfica basada en nodos para controlar y modificar modelos de IA para la generación de imágenes y vídeos. Wan 2.1 es un modelo de texto a vídeo (T2V) desarrollado específicamente para la generación de vídeos a partir de entradas de texto. Esta guía describe paso a paso cómo configurar ComfyUI con Wan 2.1 de forma local. Cada sección explica los componentes necesarios, por qué son necesarios y cómo instalarlos correctamente. Esta guía requiere Python 10 y una GPU con soporte CUDA. ...

Demo del agente de IA: Detección de spam avanzada vía ChatGPT

En este proyecto he desarrollado una extensión para Thunderbird que utiliza ChatGPT para la detección de spam avanzada. Los correos entrantes se analizan automáticamente y se clasifican según varios criterios. Un servidor local de Flask gestiona la comunicación con ChatGPT y evalúa si un mensaje debe clasificarse como spam. La implementación sirve como demostración para explorar las posibilidades de un filtrado asistido por IA en Thunderbird. Proceso Tan pronto Thunderbird recibe un nuevo correo, la extensión se activa. El mensaje se intercepta antes de que el usuario lo lea. La extensión extrae el asunto, el remitente y el texto del correo. ...

Ejecutar Ollama con modelos compatibles con GPU NVIDIA en Docker sin conexión + OpenWebUI

Aquí se ejecutó Ollama con soporte de GPU NVIDIA bajo Docker en un sistema Windows 11. Se utilizó OpenWebUI como interfaz amigable para operar modelos de IA localmente. OpenWebUI ofrece la ventaja de que los usuarios pueden cambiar fácilmente entre diferentes modelos, gestionar solicitudes y controlar el uso de la IA cómodamente mediante una interfaz gráfica. Además, permite una mejor supervisión de las instancias en ejecución y facilita la prueba de distintos modelos sin cambios de configuración manuales. ...

Red neuronal con MNIST y TensorFlow

Este código muestra cómo se entrena una red neuronal artificial con el conjunto de datos MNIST para clasificar dígitos escritos a mano (0-9). El objetivo es que el modelo pueda predecir, a partir de los datos de imagen, qué dígito está representado. Esto se logra mediante: 1. Carga y preprocesamiento de los datos de imagen de MNIST. 2. Creación de una red neuronal con varias capas (capas). 3. Entrenamiento de la red con datos de entrenamiento. 4. Evaluación del rendimiento del modelo con datos de prueba. 5. Prueba del modelo con nuevos datos de ejemplo. ...

Uso local de Ollama con llama3.2/3.3/DeepSeekv3 + llamada REST.

Descargar e instalar el entorno de ejecución LLM de Ollama (descargar). Tras la instalación, se puede acceder al servidor en http://127.0.0.1:11434/. 3. Mostrar la lista de modelos instalados. La lista debería estar vacía. ollama list 4. Descargar llama3.2 LLM y DeepSeekv3 (404 GB en disco duro y 413 GB de RAM). ollama pull llama3.2 ollama pull deepseek-v3 En la página web de Meta se pueden encontrar las versiones actuales del LLM. ...

Tutorial de Spring AI / OpenAI

Enviar pregunta a OpenAI vía Spring AI y mostrar la respuesta Crear clave OpenAI https://platform.openai.com/settings/organization/api-keys Luego, establecer la clave como variable de entorno: OPENAI_API_KEY Crear nuevo proyecto Spring Boot: https://start.spring.io/ Dentro de la aplicación Spring Boot, es decir, en el archivo “application.properties”, referenciar la clave de OpenAI o la variable de entorno (OPENAI_API_KEY). Después de crear la interfaz y las clases, la estructura del proyecto debería verse así: Después de ejecutar la prueba unitaria, la respuesta a la pregunta “Who would win in a fight between Superman and Chuck Norris?” debería mostrarse. En este caso: ...

Whisper: Transcripción automática de vídeos a texto

En esta entrada te explico cómo usar Whisper, una herramienta basada en IA de OpenAI, para la transcripción automática de vídeos. Whisper puede convertir con precisión el lenguaje hablado en varios idiomas – incluido el alemán – en texto. Por ello, es ideal para transcribir, por ejemplo, entrevistas, conferencias o vídeos personales. Instalar Python 3.10 Whisper requiere el lenguaje de programación Python y necesita una versión entre la 3.7 y la 3.10. En esta guía usamos Python 3.10 para evitar problemas de compatibilidad. ...

Configurar DNS sobre HTTPS (DoH) en Firefox

Abrir la configuración avanzada de Firefox: about:config network.trr.mode cambiar de 0 a 2. network.trr.uri cambiar a https://mozilla.cloudflare-dns.com/dns-query. network.trr.mode es una opción de configuración en Firefox que controla el uso de DNS over HTTPS (DoH). TRR significa Trusted Recursive Resolver y se refiere al uso de DoH para enviar consultas DNS a través de una conexión HTTPS cifrada, en lugar de mediante consultas DNS tradicionales sin cifrar. 0 – DoH está desactivado: Firefox utiliza exclusivamente el DNS normal sin cifrar (vía UDP o TCP) y no envía consultas DNS por HTTPS. ...

Embedding mediante la base de datos vectorial ChromaDB

Esta entrada de blog trata el concepto de embeddings y bases de datos vectoriales. En primer lugar se explica qué son los embeddings y cómo se utilizan en el campo del Natural Language Processing (NLP). A continuación, se ofrece una explicación de los vectores en un espacio con tres coordenadas y su extensión a vectores multidimensionales. Por último, se presenta ChromaDB, una base de datos vectorial especializada. ¿Qué es un embedding? Un embedding es una técnica en el ámbito del aprendizaje automático y el procesamiento de datos que tiene como objetivo transformar objetos como palabras, frases o documentos en un espacio vectorial continuo. En este espacio vectorial, los objetos similares están representados por vectores similares, lo que significa que se encuentran próximos entre sí. Los embeddings se utilizan frecuentemente para capturar y analizar el significado semántico de los textos. ...

Interfaz de usuario de Chatbot con Streamlit

Reenviar solicitudes 1:1 a ChatGPT a través de Streamlit y mostrar la respuesta. streamlit run ChatUI.py

LangChain & ChatGPT

Enviar mensaje vía LangChain a ChatGPT Aquí enviamos un mensaje vía LangChain a ChatGPT y mostramos la respuesta. Realizar un encadenamiento con “chain” Usa “chain” para encadenar el modelo y el parser. Prompts de plantilla Preparar los prompts con una plantilla. Usa la plantilla: El idioma de destino se externaliza: Más encadenamientos Encadena la plantilla con el modelo y el parser: Servidor mediante FastAPI y endpoint REST Crea mediante FastAPI un servidor. El servidor carga la aplicación (app.py), recibe la petición REST y devuelve la traducción: ...

Tutorial de Elastic Stack (Filebeat, Logstash, Elasticearch, Kibana)

Logstash Logstash es un marco de procesamiento de eventos. Con Logstach puedes importar datos de distintos tipos de marcos y orígenes de entrada. En el siguiente paso puedes filtrar y modificar los datos y, en el paso final, puedes exportarlos a diferentes formatos y marcos. Por ejemplo, puedes leer los datos desde un marco como Beats y reenviarlos a Elasticsearch para almacenamiento y procesamiento adicional. Dentro de Logstash puedes procesar, filtrar y mapear los distintos formatos de entrada y salida: ...

Encender/apagar Elgato Key Light mediante acceso directo/botón de Windows

Busca la dirección IP de tu Key Light mediante Wireless Network Watcher por ejemplo 192.168.2.227 Tu Key Light tiene un servidor web integrado que escucha en el puerto 9123 por ejemplo 192.168.2.227:9123 Envía una petición GET por ejemplo mediante Postman al siguiente endpoint para obtener más información sobre tu Key Light: http://192.168.2.227:9123**/elgato/lights** Enciende la luz usando la siguiente petición PUT. Debes establecer el valor ‘on’ a ‘1’ en lugar de ‘0’. ...

Fundamentos de fotografía + exposiciones de larga duración nítidas y tomas de paisaje

Mejor calidad: https://www.flickr.com/photos/aaron_kreis/13591624245/ Mejor calidad: https://www.flickr.com/photos/aaron_kreis/35959541982/ Para crear exposiciones de larga duración perfectamente nítidas, hay que conocer algunos conceptos básicos de la fotografía y ajustar o configurar la cámara en consecuencia. Primero explico los conceptos de forma superficial y más adelante abordaré la interacción entre ellos, p. ej., qué influencia tiene el valor ISO en el tiempo de exposición, etc. Quien quiera crear por sí mismo imágenes como las mostradas arriba, debe conocer los siguientes conceptos básicos y sus dependencias mutuas. ...

Angular & plataforma IoT de Cumulocity

Se describen los siguientes temas: Instalación de la CLI de la plataforma IoT de Cumulocity (C8Y) Creación de proyecto con la CLI de C8Y Creación de componentes Creación de una navegación (enrutamiento) Branding personalizado y uso de Bootstrap 4 en lugar de la versión 3 (predeterminado) En primer lugar necesitamos la Angular CLI de Cumulocity (C8Y) (Command Line Interface). Podemos instalar la CLI de la siguiente manera: npm install -g @c8y/cli ...