DONDE LA INTELIGENCIA ARTIFICIAL CONECTA DISCIPLINAS

Google lleva la IA conversacional al rostro: Gemini 3.8 Live incorpora avatares en tiempo real.

Google presentó Gemini 3.8 Live with Live Avatar, una tecnología destinada al ámbito empresarial que combina conversación por voz, comprensión visual y generación de video para dotar a los agentes de inteligencia artificial de una presencia visual dinámica.

Google anunció el 24 de septiembre de 2026 Gemini 3.8 Live with Live Avatar, una nueva capacidad de su sistema de inteligencia artificial conversacional que incorpora avatares capaces de escuchar, observar y responder mediante voz y video generado prácticamente en tiempo real.

La novedad representa un cambio relevante en la interfaz de los agentes de IA: la interacción deja de estar limitada al texto o a una voz sin representación visual y pasa a incorporar un personaje digital que puede hablar, sincronizar sus labios con el audio y utilizar expresiones durante la conversación.

La tecnología se encuentra disponible en Gemini Enterprise, según informó oficialmente Google.

De una voz de IA a una presencia visual

Google explica que Live Avatar combina sus capacidades de diálogo en vivo con generación de video de baja latencia. El resultado es un agente que puede recibir información visual y sonora simultáneamente y generar respuestas mediante audio y video.

Entre las capacidades anunciadas se encuentran la sincronización de labios con la voz, expresiones faciales y gestión fluida de los turnos de conversación.

La documentación técnica de Google Cloud aporta mayor precisión: Gemini 3.8 Live admite interacciones bidireccionales de voz y video y puede generar video sincronizado de los avatares a 24 fotogramas por segundo.

Esto permite imaginar aplicaciones empresariales en las que una persona no interactúe simplemente con un chatbot, sino con una representación visual de un asistente digital.

Google menciona, entre otros escenarios, atención al cliente, recorridos interactivos y asistentes o agentes virtuales. Su documentación también contempla usos como conserjes digitales, tutores virtuales y personajes interactivos.

La IA puede seguir conversando mientras realiza otras tareas

Una de las características técnicamente más relevantes no está relacionada con la apariencia del avatar, sino con lo que ocurre detrás de él.

Gemini 3.8 Live admite ejecución asincrónica de herramientas. Esto significa que el agente puede iniciar una consulta o ejecutar determinadas funciones en segundo plano y continuar manteniendo la conversación mientras espera el resultado.

Google ejemplifica esta capacidad con el registro de un huésped en un hotel: el sistema puede realizar las operaciones necesarias mediante herramientas conectadas sin interrumpir completamente el diálogo con la persona.

En entornos empresariales, Google Cloud señala que esta arquitectura puede utilizarse para efectuar llamadas a API, sistemas CRM o ERP mientras el agente continúa hablando con el usuario.

La diferencia es importante. El avatar no constituye solamente una animación asociada a una voz: puede actuar como la interfaz visible de un agente conectado a sistemas empresariales.

Conversaciones en 97 idiomas

Otro de los puntos destacados por Google es la capacidad multilingüe.

Live Avatar puede cambiar automáticamente entre 97 idiomas compatibles durante una misma conversación, adaptando simultáneamente la voz, la sincronización labial y las expresiones del avatar.

Según la compañía, el cambio puede realizarse sin necesidad de seleccionar manualmente otro idioma.

Esta funcionalidad resulta especialmente significativa para organizaciones que prestan servicios internacionales, ya que un mismo agente digital podría atender usuarios que se expresan en distintos idiomas.

Avatares prediseñados y personajes personalizados

Las organizaciones pueden seleccionar avatares de una biblioteca proporcionada por Google.

También existe la posibilidad de crear un avatar personalizado a partir de una imagen de referencia de alta calidad, preservando determinadas características visuales, identidad del personaje o estilo de marca.

Sin embargo, esta función no se encuentra abierta indiscriminadamente: Google señala que la creación de avatares personalizados está actualmente sometida a un procedimiento de autorización empresarial —allowlisting— y verificación.

La restricción tiene especial relevancia frente a los riesgos derivados de la generación de representaciones humanas sintéticas y la posible utilización indebida de identidades.

SynthID: identificar que el contenido fue generado por IA

Google también incorporó mecanismos destinados a distinguir el contenido sintético.

Según la compañía, todo el audio y video generado por Live Avatar incorpora SynthID, su sistema de marca de agua imperceptible para contenidos generados mediante inteligencia artificial.

La señal se integra directamente en el contenido y tiene como objetivo permitir posteriormente su identificación como material generado por IA, reduciendo riesgos de atribución incorrecta o desinformación.

Qué puede ver el agente

Gemini 3.8 Live no se limita a escuchar.

La documentación oficial indica que el sistema puede procesar simultáneamente audio, imágenes, video y texto. En aplicaciones compatibles también puede interpretar transmisiones procedentes de una cámara o de una pantalla compartida.

Esto amplía sustancialmente los escenarios de utilización.

Un agente podría, por ejemplo, observar aquello que el usuario le está mostrando y mantener simultáneamente una conversación sobre esa información. En términos de interfaz, se aproxima a una interacción multimodal en la que máquina y usuario comparten información visual y sonora durante el diálogo.

Los límites también forman parte de la noticia

La documentación técnica de Google DeepMind introduce algunas precisiones que resultan esenciales para evaluar la tecnología sin exagerar sus capacidades.

La compañía reconoce que Gemini 3.8 Audio puede presentar limitaciones propias de los modelos fundacionales, incluidas alucinaciones, además de posibles episodios ocasionales de lentitud o tiempo de espera.

Asimismo, señala que Gemini 3.8 Live con Live Avatar puede mantener algunos minutos de interacción continua, pero no está concebido actualmente para conversaciones ininterrumpidas durante períodos de varias horas.

Por ello, la incorporación de una apariencia humana o expresiva no debe confundirse con una garantía de exactitud de las respuestas. El avatar modifica radicalmente la forma de interacción, pero no elimina las limitaciones inherentes al modelo de inteligencia artificial que opera detrás de esa representación.

Una nueva interfaz para los agentes de inteligencia artificial

El anuncio permite observar una evolución más amplia de la IA generativa.

Durante los últimos años, la interfaz dominante fue el cuadro de texto. Luego se extendieron las conversaciones mediante voz. Con Live Avatar, Google incorpora una tercera dimensión: una presencia visual generada por IA capaz de observar, escuchar, hablar y ejecutar acciones mediante herramientas conectadas.

La tecnología se dirige inicialmente al mercado empresarial. Gemini 3.8 Live with Live Avatar está disponible en Gemini Enterprise, y Google Cloud informa disponibilidad mediante endpoints en Estados Unidos y la Unión Europea, además de opciones de infraestructura y gobernanza destinadas al despliegue corporativo.

Para empresas, estudios profesionales, servicios de atención, capacitación y organizaciones que desarrollan agentes digitales, la cuestión ya no pasa únicamente por qué puede responder una inteligencia artificial. Empieza a cobrar importancia también cómo se presenta, cómo conversa, qué puede observar y qué acciones puede ejecutar mientras mantiene esa conversación.

Transparencia informativa

Transparencia sobre el uso de IA: este informe fue elaborado con asistencia de inteligencia artificial para tareas de búsqueda, contraste de fuentes, traducción, organización y edición. La información técnica y las afirmaciones relevantes fueron verificadas utilizando las publicaciones y documentación primaria de Google, Google Cloud y Google DeepMind. Las expresiones originalmente publicadas en inglés fueron traducidas al español procurando preservar su significado y contexto.

Radio Nodo IA: los contenidos sonoros de Radio Nodo IA pueden utilizar voces generadas o asistidas mediante inteligencia artificial.

Escuchá Radio Nodo IA: una propuesta de música para acompañar la jornada en oficinas, despachos y estudios profesionales, con noticias a cada hora.

Dejá un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll al inicio