Meta lanza Muse Realtime Avatar: la tecnología que da vida a imágenes e ilustraciones en tiempo real
La compañía presentó un modelo capaz de animar rostros, cuerpos completos y objetos con latencia subsegundo y sincronización de voz, abriendo una nueva etapa en la interacción con avatars hiperrealistas.

Meta dio a conocer Muse Realtime Avatar, su más reciente avance en Inteligencia Artificial de encarnación (embodiment). Se trata de un sistema capaz de transformar imágenes estáticas, desde fotografías de retrato e ilustraciones de cuerpo completo hasta animales u objetos, en avatares hiperrealistas que interactúan, gesticulan y hablan en tiempo real durante una conversación.
La compañía explicó en su web oficial que la herramienta genera movimientos fluidos de manos, postura y expresiones faciales manteniendo la coherencia visual del personaje cuadro a cuadro a lo largo de toda la interacción.
El sistema opera conectando dos motores principales: Muse Realtime Voice encargado de la inteligencia conversacional y la generación de voz y Muse Realtime Avatar, un modelo de tipo Diffusion Transformer impulsado por audio.
Ambas herramientas comparten un flujo de datos que garantiza la sincronización exacta entre la voz, la gesticulación y el movimiento de los labios. Para lograr respuestas naturales sin interrupciones, la tecnología procesa el video en pequeños bloques continuos, conservando el contexto visual previo para evitar errores o distorsiones a medida que la conversación se extiende.
Uno de los principales desafíos de la IA en tiempo real es generar video lo suficientemente rápido sin perder calidad visual. Para resolverlo, los investigadores de Meta aplicaron técnicas de destilación y autoforzado que redujeron el cómputo de 120 evaluaciones de modelo por bloque a solo dos, logrando una eficiencia 60 veces mayor sin comprometer la resolución final.

De acuerdo con pruebas a ciegas realizadas frente a los principales competidores del mercado (como Runway Characters y HeyGen LiveAvatar), los evaluadores prefirieron la experiencia de Muse Realtime Avatar en calidad visual, sincronización y naturalidad general de ademanes.
Para desplegar esta herramienta de forma masiva, Meta rediseñó su arquitectura de inferencia en colaboración con NVIDIA. Utilizando los procesadores GB200, el sistema logra transmitir video vertical (448x768 a 25 fps) con una latencia de apenas 870 milisegundos desde que el usuario termina de hablar hasta que recibe la respuesta visualizada. Esto permite ejecutar hasta 12 sesiones interactivas simultáneas en un solo chip.
En materia de seguridad y trazabilidad, Meta confirmó que todo el contenido generado incluye Meta Video Seal, una marca de agua invisible y duradera integrada en el video sin ralentizar la transmisión, diseñada para prevenir la suplantación de identidad y el mal uso de la plataforma. La herramienta estará disponible exclusivamente para usuarios mayores de 18 años.



Comentarios