
Google llevó sus conversaciones de inteligencia artificial a un formato más visual con Gemini 3.8 Live con Live Avatar, una nueva función que permite a los agentes de IA responder mediante personajes animados capaces de mover los labios, cambiar de expresión y mantener conversaciones en tiempo real.
La herramienta fue presentada el 24 de septiembre de 2026 y está dirigida actualmente a clientes empresariales de Gemini Enterprise. Su principal novedad es combinar las capacidades de conversación en vivo de Gemini con generación de video de baja latencia para crear una presencia visual durante las interacciones.
Así funciona el nuevo avatar de Gemini
Live Avatar convierte a Gemini en un agente con una representación visual que puede escuchar, observar y responder mediante audio y video. Google explica que el sistema combina su tecnología de diálogo en tiempo real con generación de video para producir respuestas acompañadas de movimientos faciales.
Uno de los elementos centrales es la sincronización de los labios con la voz. Los avatares también pueden modificar sus expresiones y respetar los turnos de conversación, con el objetivo de que la interacción sea más parecida a una conversación frente a frente.
El sistema puede procesar simultáneamente información de audio y video, lo que permite que el agente responda tomando en cuenta diferentes tipos de información durante una misma interacción.
La tecnología está pensada principalmente para experiencias empresariales, como atención a clientes, recorridos interactivos y otros servicios en los que una compañía quiera sustituir una interfaz tradicional por un agente conversacional con presencia visual.
El avatar puede cambiar de idioma durante una conversación
Una de las características que Google destaca es su capacidad para trabajar en 97 idiomas.
Live Avatar puede cambiar de idioma durante una conversación y adaptar tanto la sincronización de los labios como las expresiones faciales al nuevo idioma. De acuerdo con Google, este cambio puede realizarse sin reducir la fidelidad del video ni provocar problemas de sincronización visual.
La función resulta especialmente relevante para empresas que atienden a clientes de diferentes países, ya que permite mantener una misma experiencia visual aunque la conversación pase, por ejemplo, del español al inglés.
No se trata únicamente de traducir el texto de una respuesta. El sistema tiene que generar simultáneamente el audio y los movimientos del rostro correspondientes a lo que está diciendo el avatar.
Gemini puede consultar información mientras sigue hablando
Otra de las funciones importantes de Gemini 3.8 Live con Live Avatar es la posibilidad de realizar llamadas asíncronas a herramientas.
En términos sencillos, el agente puede consultar información o ejecutar determinadas acciones en segundo plano mientras mantiene la conversación con el usuario. Esto busca evitar que la interacción se detenga cada vez que Gemini necesita obtener información de otro sistema.
Google utiliza como ejemplo un proceso de registro en un hotel. Mientras el avatar conversa con el huésped, puede consultar los sistemas correspondientes para obtener información de la reservación y continuar con el proceso.
Esta capacidad amplía el papel del avatar más allá de responder preguntas. En un entorno empresarial, puede funcionar como una interfaz para acceder a diferentes servicios y sistemas.
Las empresas pueden elegir o crear sus propios avatares
Google ofrecerá una biblioteca de avatares prediseñados, con diferentes apariencias, voces y estilos de expresión.
Además, las empresas podrán crear personajes personalizados a partir de una imagen de referencia. La compañía señala que esta opción permite conservar elementos como el parecido, el estilo visual de una marca o la identidad de un personaje.
Sin embargo, la creación de avatares personalizados no está abierta de manera general. Actualmente requiere acceso mediante una lista autorizada para empresas.
Esto significa que, por ahora, la nueva función está pensada principalmente para organizaciones que quieran incorporar agentes visuales a sus propios servicios y no como una nueva función disponible para cualquier usuario de la aplicación de Gemini.
¿Gemini 3.8 Live Avatar estará disponible para todos?
Por ahora, no.
Google confirmó que Gemini 3.8 Live con Live Avatar está disponible en Gemini Enterprise, por lo que su lanzamiento está orientado al mercado empresarial. No se ha anunciado que la función vaya a llegar a la aplicación convencional de Gemini para usuarios particulares.
Tampoco se ha dado a conocer un precio específico para Live Avatar en el anuncio de Google. La disponibilidad y las condiciones dependen del entorno empresarial en el que se integre la tecnología.
Por ello, aunque la presentación puede dar la impresión de que cualquier usuario podrá conversar próximamente con un avatar de Gemini, la información oficial disponible actualmente no respalda esa interpretación.
Google incorpora una medida para identificar contenido generado por IA
La compañía también señaló que el contenido producido por Live Avatar incorpora SynthID, su tecnología de marca de agua digital para contenido generado mediante inteligencia artificial.
La marca de agua se integra de manera imperceptible en el audio y el video generados por el sistema. Google explica que esta medida busca facilitar la identificación del contenido creado con IA y reducir problemas relacionados con la desinformación o la atribución incorrecta.
Esta característica cobra especial importancia en una tecnología capaz de generar rostros animados que hablan de manera sincronizada, ya que la apariencia cada vez más natural de los agentes puede dificultar que una persona distinga inmediatamente entre una interacción generada por IA y una realizada por un humano.
Un paso más hacia los agentes de IA con presencia visual
Gemini 3.8 Live ya permitía desarrollar experiencias de conversación en tiempo real, pero Live Avatar añade una dimensión visual a esa interacción.
El cambio no consiste únicamente en ponerle una cara a una voz. Google combina generación de video, reconocimiento de audio e imagen, razonamiento y ejecución de herramientas para crear agentes capaces de mantener una conversación mientras realizan tareas en segundo plano.
Por ahora, el desarrollo está enfocado en empresas y servicios digitales. Su evolución permitirá observar si este tipo de avatares termina convirtiéndose en una interfaz habitual para atención al cliente, capacitación, servicios automatizados y otras experiencias digitales.












