Gemini 3.8 Live llega a disponibilidad general, y los valores por defecto de la Live API se movieron con él
Google puso dos modelos audio a audio en GA el martes. La tabla de benchmarks es de Google; las notas de migración son la parte que te va a costar una tarde.
Google puso el martes dos modelos audio a audio en disponibilidad general: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. Los dos ya son accesibles vía la Live API en la Gemini API y Google AI Studio, y las notas de versión fechan el GA el 15 de septiembre bajo los strings gemini-3.8-live y gemini-3.8-live-extended-thinking. Las páginas de los modelos ya los listan como estables y no como preview.
El anuncio está apuntado a los agentes de voz y llega cinco días después de que OpenAI pusiera su propio modelo de voz full-duplex en disponibilidad general. Pero si ya tenés una sesión de Live API andando, las notas de migración importan más que la tabla de benchmarks.
Qué salió realmente
La model card dice que los dos modelos están construidos sobre Gemini 3 Pro. Aceptan texto, imágenes, audio y video, con una ventana de entrada de 131.072 tokens, y emiten audio y texto hasta 65.536 tokens. Google afirma que detectan y cambian entre 97 idiomas soportados en medio de la conversación, y que todo el audio generado lleva una marca de agua SynthID.
La diferencia entre los dos está en dónde ocurre el razonamiento. 3.8 Live se posiciona como el modelo por defecto para diálogo de baja latencia, con razonamiento intercalado y llamadas a función asincrónicas de fábrica. Extended Thinking razona en segundo plano mientras sigue hablando, usando confirmaciones verbales y narración del progreso para cubrir el hueco, y expone un thinking_level bajo, medio o alto. En 3.8 Live ese campo directamente no se acepta.
Más allá de la API, Google dice que 3.8 Live se está desplegando en Search Live para todo el mundo y en Gemini Enterprise en preview privada, mientras que Extended Thinking llega a Gemini Live y a superficies de Workspace, incluido Docs para suscriptores AI Pro y Ultra, y Gmail y Keep para suscriptores de Google AI.
Los puntajes son de Google
Google reporta que Extended Thinking se queda con el primer puesto general del Speech to Speech Quality Index de Artificial Analysis con 82,6, saca 68,6% en el benchmark agéntico tau-Voice y 35,1% en el tau-Voice-banking de Sierra, y llega a 97,7% en Big Bench Audio. A 3.8 Live lo ubica segundo en la Speech Agent Arena. La empresa también cita EVA-Bench de ServiceNow, con una nota al pie que aclara que la corrida fue sobre la Live API en la Gemini Enterprise Agent Platform y no en la API de desarrolladores.
Todas esas cifras son de Google. Artificial Analysis es un tercero, pero su leaderboard no era accesible desde nuestro entorno, así que no pudimos abrir el ranking que Google cita, y no había ninguna evaluación independiente de los modelos publicada al momento de escribir. Los rankings de voz a voz además son muy sensibles a la configuración: el puntaje de un competidor se mueve según si la corrida fue con razonamiento bajo, medio o alto. Tomá el orden como una afirmación del proveedor hasta que alguien más lo corra.
Cuánto cuesta
La página de precios lista una sola tabla que cubre juntos a 3.8 Live, 3.8 Live Extended Thinking y el viejo preview 3.1 Flash Live: US$0,75 por millón de tokens de texto de entrada, US$4,50 por millón de texto de salida, US$3,00 por millón de audio de entrada, US$12,00 por millón de audio de salida y US$1,00 por millón de tokens de imagen o video de entrada. El precio de salida está descrito explícitamente como incluyendo los tokens de razonamiento.
Esa tabla única es el punto que conviene masticar. Extended Thinking no cuesta más por token que 3.8 Live. Cuesta más porque emite más, y porque su razonamiento de fondo cae en el medidor de salida. Una sesión que piensa más aparece como una factura más grande y no como una tarifa más alta, lo que convierte al thinking_level en un control de costo tanto como de calidad.
El post para desarrolladores menciona US$0,005 por minuto de audio de entrada y US$0,018 por minuto de salida, y su propia nota al pie aclara que son estimaciones derivadas de las tarifas de US$3 y US$12 por millón de tokens. No son una unidad de facturación. El medidor real corre sobre tokens, y eso importa porque el turn coverage por defecto de la Live API ahora manda todos los frames de video al modelo. La documentación de Google lo dice sin vueltas y recomienda mandar frames solo cuando hagan falta para manejar contexto y costo. Si tu cliente transmite una cámara por defecto, ese default es un renglón en la factura.
La comparación con OpenAI es menos limpia de lo que sugiere cualquiera de las dos tablas. El changelog de OpenAI puso gpt-live-1 en disponibilidad general el 10 de septiembre a US$0,05 por minuto de sesión de voz, facturado por segundo, con el modelo de backend y el uso de herramientas cobrados aparte. Google cobra los tokens y mete el razonamiento en el mismo medidor; OpenAI cobra una tarifa plana de sesión y factura encima el modelo que piensa. Un número por minuto de uno y uno por token del otro no se comparan directamente, y quien proclame un ganador limpio de precio se está salteando la parte donde las cargas de trabajo difieren.
Los defaults que se movieron
Esta es la sección para leer antes de agendar la actualización. Las notas de migración de Google para salir de gemini-3.1-flash-live-preview listan cambios que rompen código que funciona, no que apenas lo degradan:
- Las llamadas a función asincrónicas y no bloqueantes pasan a ser el modo de ejecución por defecto. El modo bloqueante sincrónico sigue funcionando en 3.8 Live si lo declarás explícitamente en tus herramientas.
- thinking_level no está soportado en 3.8 Live. Sacalo, junto con thinking_config, del setup de la sesión.
- El audio proactivo queda activado de forma permanente. Poner proactive_audio en false devuelve un error.
- El diálogo afectivo fue eliminado de la API. Cualquier configuración enable_affective_dialog tiene que salir de tu código.
- El turn coverage por defecto incluye la actividad de audio y todo el video, así que los frames llegan al modelo salvo que los administres.
- El audio es la modalidad de respuesta soportada. Si necesitás transcripción de texto, activá la transcripción del audio de salida.
Extended Thinking suma encima un cambio de protocolo, y es el más propenso a producir un bug sutil en lugar de una falla ruidosa. Como el modelo razona en segundo plano, turnComplete en true ya no significa que el modelo esté inactivo: el servidor puede seguir razonando o esperando llamadas a herramientas. El cliente tiene que seguir escuchando después de esa señal y leer el campo interaction_status, que reporta IN_PROGRESS o IDLE. Extended Thinking además soporta únicamente llamadas a función asincrónicas: el modo bloqueante devuelve un error duro y las configuraciones de scheduling de funciones no están soportadas.
Lo que la Live API sigue sin hacer
Las páginas de los dos modelos listan los mismos huecos: sin caché de contexto, sin salidas estructuradas, sin ejecución de código, sin Batch API, sin URL context. El grounding con Búsqueda sí está soportado. La ausencia de salidas estructuradas es la que define arquitectura y no costo. Un agente de voz que tiene que entregarle un JSON limpio a un sistema río abajo no lo va a sacar del schema de respuesta acá; la estructura tiene que salir de una llamada a función o de un segundo modelo de texto leyendo la transcripción. Es un diseño normal, pero es una decisión de diseño que la API toma por vos.
El viejo gemini-3.1-flash-live-preview ahora figura como modelo legacy de preview de la Live API en la propia lista de Google, con una recomendación explícita de actualizar. El modelo dedicado de voz a texto de Google, Gemini 3.5 Transcribe, salió el mes pasado y no es novedad de hoy, aunque el post para desarrolladores lo agrupe en la misma suite de audio.
La lectura práctica: si arrancás de cero esta semana, 3.8 Live es el default razonable y Extended Thinking es para llamadas que realmente implican trabajo de varios pasos. Si ya tenés uno en producción, presupuestá la migración como un cambio de código y no como un cambio de versión, fijate si tu cliente trata a turnComplete como señal de inactividad, y mirá cuánto te cuesta el stream de video antes de mirar el leaderboard.
Por qué importa
- Un agente de voz que corre sobre gemini-3.1-flash-live-preview no se muda a los modelos nuevos cambiando el string del modelo. Las llamadas a función asincrónicas pasaron a ser el modo por defecto, el audio proactivo ya no se puede apagar y el diálogo afectivo fue eliminado de la API directamente.
- La Live API factura por token, no por minuto, y ahora manda los frames de video al modelo por defecto. Esos dos hechos definen la factura mucho más que la cifra por minuto del anuncio, que la propia Google marca como una estimación.
- Ninguno de los dos modelos soporta salidas estructuradas ni caché de contexto. Cualquier agente de voz que necesite un contrato JSON tiene que sacar esa estructura de una llamada a función o de un modelo de texto aparte, y eso es una restricción de diseño, no un detalle de configuración.
Puntos clave
- Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking llegaron a disponibilidad general el 15 de septiembre vía la Gemini API y Google AI Studio, como gemini-3.8-live y gemini-3.8-live-extended-thinking.
- Los dos están basados en Gemini 3 Pro, aceptan texto, imágenes, audio y video hasta 131.072 tokens de entrada, emiten hasta 65.536 y detectan y cambian entre 97 idiomas en medio de la conversación.
- Una sola tabla de precios cubre a ambos: US$3,00 por millón de tokens de audio de entrada, US$12,00 por millón de audio de salida, y US$0,75 y US$4,50 por millón de tokens de texto de entrada y salida, con los tokens de razonamiento facturados como salida.
- Los cambios que rompen código existente incluyen llamadas a función no bloqueantes por defecto, thinking_level rechazado en 3.8 Live, audio proactivo permanentemente activado y turnComplete que ya no señala una sesión inactiva en Extended Thinking.
- Todas las cifras de benchmarks del anuncio son de Google. No había ninguna evaluación independiente publicada al momento de escribir esta nota.
Fuentes
- GoogleFuente primariaIntroducing Gemini 3.8 Live and 3.8 Live Extended Thinkingblog.google
- GoogleFuente primariaBuild real-time voice applications with Gemini 3.8 Live and 3.5 Transcribeblog.google
- Google AI for DevelopersFuente primariaGemini API release notes, September 15, 2026ai.google.dev
- Google DeepMindFuente primariaGemini 3.8 Audio (Live, Live Extended Thinking) model carddeepmind.google
- Google AI for DevelopersFuente primariaGemini Developer API pricingai.google.dev
- Google AI for DevelopersFuente primariaGemini 3.8 Live model page and migration notesai.google.dev
- Google AI for DevelopersFuente primariaGemini 3.8 Live Extended Thinking model page and upgrade notesai.google.dev
- OpenAIFuente primariaOpenAI API changelog: GPT-Live 1 generally availabledevelopers.openai.com
- OpenAIFuente primariaOpenAI API pricingdevelopers.openai.com
- voice-agents
- live-api
- speech-to-speech
- api-pricing
- migration
- function-calling
- Google DeepMind
- OpenAI
- Gemini 3.8 Live
- Gemini 3.8 Live Extended Thinking
- Gemini 3.1 Flash Live
- GPT-Live-1