Los avatares de Gemini llegan a GA y el video se factura a 6.192 tokens por segundo
Gemini 3.8 Live con Live Avatar ya está disponible en Gemini Enterprise. Google publicó las tasas de conversión de tokens, así que el costo de la presencia visual se calcula fácil: unos US$0,37 por minuto de habla, cerca de 21 veces el audio que acompaña.
Google puso Gemini 3.8 Live con Live Avatar en disponibilidad general dentro de Gemini Enterprise el 24 de septiembre, sumándole una cara de video generada y sincronizada con los labios a los modelos de diálogo en vivo que había anunciado la semana anterior. Los avatares animados no son ninguna novedad y la función en sí es incremental. Lo realmente útil es que Google publicó el medidor: el stream de video del avatar se factura a 6.192 tokens por cada segundo que habla.
Ese número hace casi todo el trabajo. Al precio de lista de US$1,00 por millón de tokens de video del avatar, un avatar hablando cuesta unos US$0,37 por minuto, o cerca de US$22 por hora de habla efectiva. El audio con el que sincroniza los labios se factura a 25 tokens por segundo contra una tarifa de US$12,00 por millón: alrededor de 1,8 centavos por minuto. Ponerle cara a un agente de voz cuesta, entonces, del orden de 21 veces lo que cuesta la voz sola, antes de contar los tokens de entrada y de razonamiento.
Qué se lanzó realmente
Live Avatar combina generación de video casi en tiempo real con el diálogo nativo speech-to-speech de Gemini, así el modelo escucha, ve y habla a través de una persona visual en lugar de devolver solo audio. Google afirma que mantiene la sincronía labial y la expresión facial en 97 idiomas con detección automática, y que puede cambiar de idioma en medio de la conversación sin, según sus palabras, "degradar la fidelidad del video ni introducir deriva visual".
- Llamadas a herramientas asincrónicas — el modelo dispara llamadas a herramientas y APIs en segundo plano y sigue hablando mientras se ejecutan, en vez de quedarse mudo durante una consulta.
- Comprensión visual en vivo — procesa cámara y pantalla compartida junto con el audio en la misma sesión.
- Biblioteca de avatares y avatares personalizados — los avatares predefinidos están disponibles para todos los clientes; los personalizados, generados a partir de una sola imagen de referencia de alta calidad, quedan detrás de una allowlist empresarial con verificación.
- Marca de agua SynthID — incorporada en todo stream de audio y video generado.
- Endpoints en EE.UU. y la UE, con throughput aprovisionado disponible a través de un representante comercial de Google Cloud.
Gemini 3.8 Live Extended Thinking, anunciado junto con el modelo Live base, sigue en private preview. Google dice que Live Avatar se mostró por primera vez en Cloud Next 2026.
El mecanismo de facturación que importa más que la tarifa
La parte de la página de precios que va a definir las facturas reales no es el precio por token. La Live API cobra por turno todo lo que hay en la ventana de contexto de la sesión, y Google aclara sin vueltas que los tokens de turnos anteriores "se reprocesan y se facturan en cada turno nuevo", hasta el límite de contexto configurado. Una sesión de voz acumula contexto rápido: al ritmo documentado de 25 tokens por segundo de audio, diez minutos de conversación son unos 15.000 tokens, y cada turno posterior los vuelve a pagar enteros.
Para eso no hay descuento listado. Las filas de Gemini 3.8 Live API en la tabla de precios muestran el input cacheado como N/A, mientras que Gemini 3.1 Pro Preview en esa misma tabla lista input cacheado a US$0,20 y US$0,40 por millón de tokens. Lo que el context caching aporta en cargas batch y de chat, acá no se ofrece. Las conversaciones largas son el caso caro, y los 6.192 tokens por segundo del avatar se montan arriba de eso — aunque Google sí aclara que el video se cobra solo mientras el avatar habla, no mientras escucha.
Lo que Google no mostró
El anuncio no trae cifras de latencia ni benchmarks. Toda afirmación de calidad que lo acompaña viene de clientes, no de mediciones propias publicadas por Google ni de evaluación independiente.
Gemini 3.8 Live mejoró el manejo de interrupciones, las conversaciones multilingües y la confiabilidad en las llamadas a herramientas.
Equal AI también dice que maneja más de un millón de llamadas en vivo por día en nueve idiomas de la India. Cox Automotive describe un asistente de compras para Autotrader construido sobre la función, y Salesforce señala que está explorando combinar Gemini 3.8 Live con Agentforce. Son testimonios provistos por el proveedor y conviene leerlos como tales. Al momento de publicar esta nota no había pruebas independientes de Live Avatar.
Si estás construyendo agentes de voz
La lectura práctica es que lo que importa acá son las llamadas a herramientas asincrónicas, y no hacen falta avatares para aprovecharlas. El silencio mientras corre una herramienta es la forma más segura de que un agente de voz se sienta roto; que el modelo pueda acusar recibo y seguir hablando mientras se completa una consulta ataca ese problema de frente. La cara es una decisión aparte, con su propio medidor.
Si igual la activás, calculá unos 37 centavos por minuto hablado encima de los costos de audio y razonamiento, y fijate si la presencia visual justifica eso frente a una sesión de voz sola que corre por debajo de dos centavos el minuto. Una aclaración de alcance antes de planificar: esto es un lanzamiento de Gemini Enterprise, no una función general de la Gemini API — la documentación pública de la Live API de Google no menciona Live Avatar, y los avatares personalizados requieren allowlist además de eso.
Por qué importa
- Google publicó las tasas de conversión de tokens por segundo del video del avatar, lo que la convierte en una de las pocas funciones multimodales que podés costear con precisión antes de construir sobre ella: 6.192 tokens por segundo de habla contra una tarifa de US$1,00 por millón.
- La Live API refactura el contexto acumulado de la sesión en cada turno y no lista precio de input cacheado, así que las conversaciones de voz largas se encarecen progresivamente por turno. Eso es una restricción de diseño para agentes conversacionales, no una nota al pie de la factura.
- Las llamadas a herramientas asincrónicas atacan la falla más común de los agentes de voz —el silencio mientras corre una herramienta— y están disponibles sin adoptar el avatar ni su costo de video por segundo.
Puntos clave
- Gemini 3.8 Live con Live Avatar está en disponibilidad general en Gemini Enterprise desde el 24 de septiembre, con endpoints en EE.UU. y la UE y throughput aprovisionado; Gemini 3.8 Live Extended Thinking sigue en private preview.
- El video del avatar se factura a 6.192 tokens por segundo a US$1,00 el millón — unos US$0,37 por minuto de habla, cerca de 21 veces el costo del audio con el que sincroniza — y se cobra solo mientras el avatar habla.
- La Live API cobra por turno toda la ventana de contexto de la sesión y reprocesa los turnos anteriores en cada turno nuevo; sus filas listan el input cacheado como N/A, a diferencia de Gemini 3.1 Pro Preview en la misma tabla.
- Google no publicó cifras de latencia ni benchmarks. Las afirmaciones de calidad vienen de clientes como Equal AI, Cox Automotive y Salesforce, y no había evaluación independiente al momento de publicar.
Fuentes
- GoogleFuente primariaIntroducing Gemini 3.8 Live with Live Avatarblog.google
- Google CloudFuente primariaPower your agents: Gemini 3.8 Live with Live Avatar is now generally availablecloud.google.com
- Google CloudFuente primariaGemini Enterprise Agent Platform pricing — Generative AIcloud.google.com
- Google AI for DevelopersFuente primariaGemini Live API overviewai.google.dev
- gemini
- live-api
- voice-agents
- avatars
- api-cost
- tool-calling
- multimodal
- context-window
- enterprise-ai
- Google DeepMind
- Google Cloud
- Equal AI
- Cox Automotive
- Salesforce
- Gemini 3.8 Live
- Gemini 3.8 Live Extended Thinking
- Gemini 3.1 Pro Preview