Promptea.
Lanzamiento de modeloImportante

Gemini 3.8 Flash mantiene el precio por token y sube los tokens por tarea

El tercer modelo Flash de Google en seis semanas sale a la misma tarifa de US$0,75 / US$3,75, pero está hecho a propósito para gastar más tokens. La variante de seguridad queda detrás de un programa de 650 socios, y el precio introductorio se duplica el 1 de enero.

Promptea Editorial8 min de lectura

Google lanzó Gemini 3.8 Flash el 2 de septiembre, tres semanas después de 3.7 Flash y —según la propia cuenta de Google— su tercer modelo Flash en seis semanas. El número principal es que no cambió nada: US$0,75 por millón de tokens de entrada y US$3,75 por millón de salida, la misma tarifa introductoria que tiene 3.7 Flash. El ID del modelo es `gemini-3.8-flash` y ya está disponible en la API de Gemini, AI Studio, Antigravity, Android Studio, Stitch y Gemini Enterprise, además de la app de Gemini, AI Mode en Search y Gemini en Sheets para suscriptores de AI Pro y Ultra.

En paralelo, Google publicó Gemini 3.8 Flash Cyber, una variante del mismo modelo base ajustada para encontrar y parchear vulnerabilidades, que no podés comprar: solo está disponible a través de un programa cerrado. Para quien tenga que presupuestar o cambiar de modelo, los datos útiles están en la página de precios y en la model card, no en el anuncio.

La tarifa no se mueve. La factura probablemente sí.

Google es inusualmente directo acá. El anuncio dice que las mejoras "surgen de una decisión de diseño central: 3.8 Flash trabaja más" —pasos de razonamiento extra, llamadas iterativas a herramientas y "por momentos, el modelo puede usar más tokens para maximizar el rendimiento, sobre todo en niveles de esfuerzo altos". Esa última frase también aparece en la sección de Limitaciones Conocidas de la model card, que es la ubicación más reveladora.

En la API de Gemini los tokens de salida se facturan incluyendo los tokens de razonamiento. Así que una tarifa plana por token más un modelo diseñado a propósito para emitir más tokens por tarea no dan un costo plano por tarea. La recomendación de Google es bajar el nivel de esfuerzo, o quedarse en 3.7 Flash para cargas donde la eficiencia manda —que, aclara, "sigue plenamente soportado". Que un proveedor te diga que su modelo anterior puede ser la mejor compra conviene tomarlo en serio.

Una ruptura concreta para código existente: 3.8 Flash documenta tres niveles de razonamiento —bajo, medio y alto—. `minimal` no está soportado y devuelve error en lugar de degradarse.

El precio introductorio tiene fecha de vencimiento

La palabra "introductorio" hace un trabajo real acá. La página de precios de Google lo dice sin vueltas:

  • Entrada: US$0,75 por millón de tokens hasta el 31 de diciembre de 2026, y US$1,50 desde el 1 de enero de 2027
  • Salida (incluyendo tokens de razonamiento): US$3,75 hasta el 31 de diciembre de 2026, y después US$7,50
  • Batch: US$0,375 / US$1,875, pasando a US$0,75 / US$3,75
  • Entrada cacheada: US$0,075, pasando a US$0,15
  • Almacenamiento de caché: US$0,50 por millón de tokens por hora, pasando a US$1,00

Todo se duplica en la misma fecha, y el mismo cronograma aplica a 3.7 Flash. Cuatro meses de margen alcanzan para planificar y son pocos como para olvidarse.

Qué cambió realmente

Menos de lo que sugiere el salto de versión. La model card dice que Gemini 3.8 Flash "está basado en Gemini 3.7 Flash", y sus secciones de arquitectura, dataset de entrenamiento, procesamiento de datos, hardware y software remiten todas a la card de 3.7 Flash en vez de describir algo nuevo. Es una iteración sobre un modelo ya post-entrenado, no una base nueva. Los límites de contexto no cambian: 1.048.576 tokens de entrada y 65.536 de salida.

El corte de conocimiento figura como marzo de 2026, con una salvedad que conviene leer: el usuario "puede esperar información actualizada en algunos dominios, mientras que en otros el conocimiento del modelo está limitado a enero de 2025". Un corte que varía catorce meses según el dominio no es realmente un solo corte, y suele aparecer como desactualización con tono seguro y no como una negativa.

En capacidad, Google reporta 54,9% en HLE-Verified y dice que 3.8 Flash supera a la mayoría de los modelos frontier más grandes en DeepSWE v1.1 para ingeniería de software de horizonte largo, y que le gana a 3.7 Flash y a otros modelos frontier en Vals Finance Agent V2 y en el Legal Agent Benchmark de Harvey. Todos esos números salen de evaluaciones corridas por Google. No hay ninguna evaluación independiente publicada.

La variante Cyber, y por qué no podés usarla

Gemini 3.8 Flash Cyber comparte la misma inteligencia de base y está ajustado para descubrimiento autónomo de vulnerabilidades y parcheo automatizado. Sale con lo que Google llama "un conjunto más permisivo de mitigaciones para ciberseguridad" y por eso queda restringido al nuevo Programa Fairwind: gobiernos y autoridades nacionales de ciberseguridad, operadores de infraestructura crítica en salud, telecomunicaciones, energía y finanzas, y plataformas tecnológicas centrales. Google dice tener más de 650 socios participantes a nivel global. Los participantes se comprometen a limitar el acceso a personal de equipos internos de ciberseguridad, respuesta a incidentes o pentesting, y a desplegar protecciones como autenticación multifactor.

Dentro del programa el modelo corre en el harness CodeMender, en el entorno cloud de la propia organización, produciendo parches como diffs de código estándar validados por un paso de LLM como juez. Google encuadra el escalonamiento como una asimetría deliberada —el acceso temprano le da a los defensores "una ventana de adaptación vital para endurecer sus sistemas antes de que los actores maliciosos tengan chance de explotar nuevas capacidades"— y dice que priorizó la corrección por encima de capacidades ofensivas como la explotación desde el principio.

Si una barrera así se sostiene es una pregunta abierta, dado que el 3.8 Flash general es público y comparte la misma base. Pero la forma de la decisión es clara: Google construyó su modelo de seguridad más capaz, decidió que la disponibilidad general era el default equivocado y escribió un régimen de control de acceso alrededor. Ese precedente es más interesante que la tabla de benchmarks.

El único benchmark externo cuenta una historia más callada

CWE-Bench, operado por Collinear, es el único benchmark de terceros en el material de lanzamiento, y es justo donde Google no dice ganar. Gemini 3.8 Flash Cyber saca 47,2% de pass@1. Fable 5, de Anthropic, saca 47,8%. La afirmación de Google no es que el modelo parchee mejor: es que está en la frontera de Pareto —calidad casi equivalente a un costo bastante menor—. Es una afirmación real y útil, y es distinta de "rendimiento a nivel frontier", que es como abre el anuncio.

El resto de la evidencia es de Google. En CyberGym dice que el modelo supera a 3.5 Flash Cyber y a modelos frontier bastante más grandes, pero no publica ninguna cifra. La tasa de éxito "superior al 70%" en bases de código de 20 lenguajes se apoya en un benchmark interno que Google no liberó, así que no se puede reproducir. El hallazgo de Chrome Security de 2,6 veces más parches correctos que los mejores modelos comerciales viene del propio equipo de Google, y el reporte de Wiz de 7,5% a 9,7% más recall a un costo 2,3 a 5,2 veces menor es un socio citando su propio benchmark de pentesting no publicado. Nada de esto es raro en un lanzamiento, y nada de esto es independiente.

Dos líneas en la sección de seguridad

Primero: Gemini 3.8 Flash no fue evaluado por sí mismo contra el Frontier Safety Framework de Google. La model card dice que Google evaluó 3.7 Flash, encontró que no alcanzaba ningún Tracked o Critical Capability Level, determinó que 3.8 Flash no tiene capacidades nuevas significativas en los dominios del framework, y por eso está "seguro de que Gemini 3.8 Flash también es improbable que alcance algún T/CCL". Dada una base compartida, es un atajo defendible —pero es una inferencia y no una medición, y un modelo promocionado por su razonamiento de código y ciberseguridad sustancialmente mejor está heredando su aprobación de riesgo frontier de su predecesor.

Segundo: las propias evaluaciones automatizadas de seguridad de Google no mejoran de forma pareja. La seguridad texto a texto mejoró 0,4pp y la de imagen a texto quedó igual, pero la seguridad multilingüe se movió 5,4pp en la dirección equivocada en una métrica donde menos es mejor, y los rechazos injustificados subieron 1,1pp. Google llama al resultado en idiomas no ingleses una regresión leve y dice que la revisión manual encontró que las pérdidas eran en su mayoría falsos positivos o no graves. Si atendés usuarios que no hablan inglés, ese es el número a mirar. Google también afirma un "salto significativo" en robustez frente a inyección de prompts medido por Gray Swan, y no publica ninguna cifra.

Qué hacer en concreto

  1. Si corrés agentes sobre Flash y el costo importa, medí 3.8 en esfuerzo bajo contra 3.7 con tu propia carga antes de migrar. La tarifa es idéntica, así que la única variable que mueve tu factura son los tokens por tarea —y Google dice que ese número sube.
  2. Si tu código fija el nivel de razonamiento en `minimal`, va a dar error en 3.8 Flash. Arreglalo antes de enrutar tráfico.
  3. Si alguna proyección de 2027 asume US$0,75 / US$3,75, duplicala. El aumento está documentado, no es especulación.
  4. Si atendés usuarios que no hablan inglés, corré tus propios chequeos de seguridad y de rechazos en vez de confiar en el salto de versión.
  5. Si operás infraestructura crítica o mantenés software de uso amplio, Fairwind es la única vía al modelo Cyber.

El resumen honesto: un lanzamiento incremental competente, con una trampa de costos bien documentada y una decisión de gobernanza genuinamente notable pegada al lado. La documentación de Google es más informativa que su anuncio, lo cual es un elogio a la documentación.

Por qué importa

  • La tarifa por token no cambia, pero el modelo está diseñado explícitamente para gastar más tokens por tarea, así que migrar a 3.8 Flash puede subirte la factura sin que aparezca ningún cambio de precio.
  • La tarifa de US$0,75 / US$3,75 es introductoria y se duplica el 1 de enero de 2027 —un aumento documentado y con fecha que cualquier modelo de costos para 2027 tiene que reflejar.
  • Google retuvo su modelo de seguridad más capaz de la disponibilidad general y construyó un programa de control de acceso en su lugar, un precedente de gobernanza con el que se va a medir a otros laboratorios.
  • Casi todas las cifras de rendimiento del lanzamiento son de Google; el único benchmark externo muestra al modelo Cyber levemente por detrás de Fable 5 de Anthropic, compitiendo por costo y no por calidad.

Puntos clave

  • Gemini 3.8 Flash está disponible como `gemini-3.8-flash` a US$0,75 por millón de tokens de entrada y US$3,75 por millón de salida, con ventana de entrada de 1.048.576 tokens y límite de salida de 65.536.
  • Google dice que el modelo 'trabaja más' —pasos de razonamiento extra y llamadas iterativas a herramientas— y lista el mayor uso de tokens en esfuerzo alto dentro de Limitaciones Conocidas; recomienda bajar el esfuerzo o quedarse en 3.7 Flash si la eficiencia manda. Solo se soportan los niveles bajo, medio y alto: `minimal` ahora devuelve error.
  • El precio se duplica el 1 de enero de 2027 a US$1,50 / US$7,50, con las tarifas de batch, entrada cacheada y almacenamiento de caché subiendo en la misma proporción.
  • Gemini 3.8 Flash Cyber está restringido al nuevo Programa Fairwind —más de 650 socios verificados de gobierno, infraestructura crítica y plataformas, con MFA obligatorio y acceso limitado a equipos internos de seguridad.
  • En CWE-Bench, el único benchmark de terceros citado, 3.8 Flash Cyber saca 47,2% de pass@1 contra 47,8% de Fable 5; la afirmación de Google es de eficiencia de costo, no de superioridad.
  • La model card muestra que 3.8 Flash no fue evaluado por sí mismo bajo el Frontier Safety Framework —la aprobación se hereda de 3.7 Flash— y que la seguridad multilingüe retrocedió 5,4pp en una métrica donde menos es mejor.

Fuentes

  1. GoogleFuente primaria
    Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
    blog.google
  2. GoogleFuente primaria
    Proactive cyber defense for governments and enterprises (Fairwind Program)
    blog.google
  3. Google DeepMindFuente primaria
    Gemini 3.8 Flash - Model Card
    deepmind.google
  4. GoogleFuente primaria
    Gemini Developer API pricing
    ai.google.dev
  5. GoogleFuente primaria
    Gemini API changelog - Gemini 3.8 Flash generally available
    ai.google.dev
  6. GoogleFuente primaria
    Gemini 3.8 Flash model documentation
    ai.google.dev
  7. Google DeepMindFuente primaria
    Gemini 3.8 Flash Cyber
    deepmind.google
Etiquetas:
  • gemini
  • model-release
  • api-cost
  • coding-agents
  • security
  • context-window
  • benchmarks
  • ai-safety
  • prompt-injection
Empresas:
  • Google
  • Google DeepMind
  • Anthropic
  • Wiz
  • Collinear
  • Gray Swan
Modelos:
  • Gemini 3.8 Flash
  • Gemini 3.8 Flash Cyber
  • Gemini 3.7 Flash
  • Fable 5
Gemini 3.8 Flash: mismo precio, más tokens por tarea · Promptea