La semana de las versiones intermedias y de una apuesta de USD 500.000 millones al cómputo
Entre el 9 y el 15 de agosto los laboratorios compitieron por precio, latencia y duración de las tareas, no por capacidad. El número más grande de la semana fue de NVIDIA y fue un anuncio financiero.
Cubre del 09-08-2026 al 15-08-2026
Entre el 9 y el 15 de agosto, los lanzamientos de modelos relevantes fueron versiones intermedias. Google actualizó su modelo barato. SpaceXAI actualizó su modelo insignia. OpenAI directamente no lanzó ningún modelo: sólo mostró una forma más rápida de servir el que ya tiene. Y el número más grande de la semana no salió de ninguno de ellos, sino de NVIDIA, en un anuncio financiero.
Ese es el hilo que conviene llevarse de la semana. Los laboratorios compitieron por precio, latencia y por cuánto tiempo un modelo puede sostener una tarea, no por cuánto sabe. Mientras tanto, se reacomodó la estructura de capital que hay debajo del cómputo.
Los lanzamientos fueron incrementales y compitieron por costo y velocidad
Gemini 3.7 Flash salió el 13 de agosto, tres semanas después de 3.6 Flash, algo que la propia Google señala en el anuncio. Tiene un precio introductorio de USD 0,75 por millón de tokens de entrada y USD 3,75 por millón de salida, vigente hasta fin de año. Google reporta mejoras sobre su propio modelo anterior en FrontierCode 1.1 Main (43,6% contra 34,4%), DeepSWE v1.1 (65,3% contra 49,0%), el benchmark documental GDP.pdf (34,0% contra 22,0%), AutomationBench (30,4% contra 17,0%) y el Elo de WebDev Arena (1588 contra 1538). Todas esas comparaciones las corrió Google contra un modelo de Google: todavía no hay evaluación independiente de 3.7 Flash.
OpenAI no lanzó un modelo. El 13 de agosto presentó en vista previa el modo Ultrafast, una capa de servicio premium para GPT-5.6 Sol que su changelog de API describe con hasta 14 veces la velocidad del procesamiento estándar, disponible en preview limitada para clientes seleccionados mediante un formulario. El titular fue el rendimiento de servicio, no la capacidad, y eso ya dice dónde está la competencia.
Grok 4.6 salió el 12 de agosto, apuntado a agentes que corren durante muchos pasos, y mantiene el precio de lista de Grok 4.5: USD 2 y USD 6 por millón de tokens de entrada y salida. Según la propia tabla de SpaceXAI, obtiene 61 en el Artificial Analysis Intelligence Index, empatando con GPT-5.6 Sol Max y quedando detrás de Fable 5 Max, que marca 62. La página de anuncio de SpaceXAI devuelve 403 a clientes automatizados desde nuestro entorno, así que ese lanzamiento entra acá por nuestra propia cobertura del miércoles y no por una página que hayamos podido abrir.
Qué implica para planificar costos
Para quien presupuesta un agente que corre de forma continua, lo más útil de la semana es que el precio con el que uno planifica es cada vez más un precio temporal. La tarifa de Gemini 3.7 Flash es explícitamente introductoria y vence a fin de año. Grok 4.6 publicita un precio de lista sin cambios mientras la estructura de tarifas que hay debajo no es plana. Ultrafast es una capa premium sin precio público durante la preview. Son tres formas distintas de "cuánto cuesta esto realmente" en una sola semana.
La consecuencia práctica es aburrida pero concreta: en cargas con agentes, el precio de vidriera pasó a ser uno de los datos menos estables de una estimación, y conviene revisarlo periódicamente y no una sola vez al elegir modelo.
El número más grande de la semana fue financiero, no técnico
El 10 de agosto NVIDIA anunció memorandos de entendimiento con Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs y KKR para crear plataformas independientes de financiamiento de cómputo, con el objetivo de movilizar más de USD 500.000 millones de capital de terceros para infraestructura de IA a lo largo del tiempo. El propio subtítulo de NVIDIA lo dice sin vueltas: convertir su cómputo e infraestructura en "una clase de activo invertible". La cita de Jensen Huang en el comunicado es todavía más directa: "En IA, el cómputo es ingreso".
Conviene leer la estructura antes que el número. Son memorandos de entendimiento que describen una intención, no fondos cerrados. El comunicado no informa capital comprometido, fechas de cierre ni cómo se estructurarían los vehículos, y los USD 500.000 millones son capital a movilizar con el tiempo, no dinero levantado. Lo que se anunció es la intención de volver financiable la capacidad de GPU para inversores institucionales, del mismo modo que ya lo son las autopistas de peaje o los centros de datos.
Va al lado de los lanzamientos porque ambos son argumentos sobre economía unitaria. Si las mejoras de capacidad por lanzamiento se achican mientras el volumen de inferencia sube, el activo escaso es la capacidad de servir tokens: exactamente lo que seis de los mayores asignadores de capital del mundo acaban de ser invitados a financiar.
Los pesos abiertos siguieron llenando la franja chica
Meta publicó Muse Glimmer el 10 de agosto, destilado a unos 30.000 millones de parámetros y liberado bajo Apache 2.0 para uso agéntico local. NVIDIA siguió el 11 de agosto con Nemotron 3.5 Lightning, un modelo abierto de mezcla de expertos de 30.000 millones de parámetros para tareas de agentes de alto volumen, que según NVIDIA entrega hasta 4 veces más velocidad de salida y completa tareas agénticas un 30% más rápido que otros de su categoría; de nuevo, medición propia de la empresa. Junto con eso liberó NeMo Switchyard, una biblioteca de ruteo de código abierto para dirigir cada pedido al modelo más adecuado dentro de una mezcla de modelos abiertos, propietarios y de NVIDIA.
El informe de verano de Hugging Face, publicado el 14 de agosto, aporta la forma de ese ecosistema con números en vez de impresiones. Los repositorios públicos de modelos pasaron de 2,43 a 2,96 millones entre enero y agosto, y los datasets de 711.000 a 1 millón. Pero alrededor del 85,6% de los modelos tiene menos de 200 descargas en toda su vida, y el 1,5% de los repositorios concentra el 99,2% de las descargas. El informe también señala que las dos organizaciones que más modelos abiertos nuevos publicaron este año son las fabricantes de hardware, AMD y NVIDIA, cada una con más de 200 repositorios nuevos.
También esta semana
- La app de Gemini superó los 1.000 millones de usuarios mensuales (11 de agosto). Google lo describió como el producto de crecimiento más rápido de su historia, con más de 150 millones de imágenes generadas por día y más de 100 millones de usuarios activos en iOS. Todas las cifras son de Google y se publicaron sin metodología.
- Anthropic explicó cómo funciona la marca de agua de texto de Claude (14 de agosto), incluyendo dónde no funciona: pasajes cortos, escritura factual con pocas alternativas equivalentes de palabra, corrección de texto humano y código, donde la empresa dice que la marca directamente no se aplica. El texto sirve sobre todo porque declara sus propios límites.
El hilo de la semana
Fue una semana en la que la ingeniería interesante estuvo en servir y en financiar antes que en entrenar, y en la que cada cifra de rendimiento publicada vino de la empresa que vende lo que se midió. Ninguna de las dos cosas es un reproche. Pero si estás decidiendo qué correr en septiembre, la semana te dio mucha más información sobre cuánto va a costar la inferencia y quién va a pagar la capacidad que sobre qué cosas nuevas pueden hacer los modelos.
Por qué importa
- Esta semana cambió más la planificación de costos que la capacidad: precio introductorio con fecha de vencimiento, un precio de lista que no es plano y una capa premium sin precio, todo en siete días.
- Todas las cifras de rendimiento publicadas con los tres lanzamientos las corrieron las propias empresas; todavía no hay evaluación independiente de ninguno.
- Los USD 500.000 millones de NVIDIA son una intención de movilizar capital, no financiamiento cerrado: la distinción importa si uno lo lee como señal de demanda.
- La actividad en pesos abiertos se concentra en la franja de unos 30.000 millones de parámetros, la que corre en hardware que los desarrolladores ya tienen.
Puntos clave
- Gemini 3.7 Flash salió tres semanas después de 3.6 Flash con un precio introductorio de USD 0,75 y USD 3,75 por millón de tokens de entrada y salida, vigente hasta fin de año.
- OpenAI no lanzó ningún modelo nuevo: presentó en preview limitada el modo Ultrafast para GPT-5.6 Sol, con hasta 14 veces la velocidad de procesamiento estándar.
- NVIDIA firmó memorandos de entendimiento con seis instituciones financieras para movilizar más de USD 500.000 millones de capital de terceros, presentando el cómputo como clase de activo invertible.
- Muse Glimmer de Meta y Nemotron 3.5 Lightning de NVIDIA pusieron modelos agénticos de pesos abiertos de unos 30.000 millones de parámetros en la franja local.
- Hugging Face contó 2,96 millones de repositorios públicos de modelos, con el 1,5% concentrando el 99,2% de las descargas.
Fuentes
- NVIDIAFuente primariaNVIDIA Partners With Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs and KKR to Establish AI Compute Infrastructure Financing Platforms to Mobilize Over $500 Billion of Third-Party Capitalnvidianews.nvidia.com
- NVIDIAFuente primariaNVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AIblogs.nvidia.com
- GoogleFuente primariaMore than 1 billion people are using the Gemini app every monthblog.google
- GoogleFuente primariaIntroducing Gemini 3.7 Flashblog.google
- OpenAIFuente primariaOpenAI API changelog: Ultrafast mode preview for GPT-5.6 Soldevelopers.openai.com
- AnthropicFuente primariaHow Claude's text watermark worksanthropic.com
- Hugging FaceFuente primariaState of Open Models: Summer 2026 Observationshuggingface.co
- Hugging FaceMeta is back with Muse Glimmer: local, agentic, multimodal, and open sourcehuggingface.co
- Promptea AI DailySpaceXAI releases Grok 4.6: same price as 4.5, mixed results on its own benchmarkspromptea.me
- weekly-recap
- api-pricing
- open-weights
- ai-infrastructure
- agents
- benchmarks
- NVIDIA
- OpenAI
- Anthropic
- Meta
- SpaceXAI
- Hugging Face
- Gemini 3.7 Flash
- GPT-5.6 Sol
- Grok 4.6
- Muse Glimmer
- Nemotron 3.5 Lightning
- Claude