NVIDIA lanza un chip de decode con el nombre de un competidor
Groq 3 LPX entra en producción plena en Hot Chips y parte la inferencia en dos tipos de silicio. Las cifras de eficiencia son de NVIDIA y siguen pendientes de revisión.
NVIDIA anunció el lunes que Groq 3 LPX, un acelerador de inferencia que lleva el nombre de un competidor bajo licencia, entró en producción plena. El anuncio llegó en el primer día completo de Hot Chips 2026 en Stanford, donde NVIDIA presenta su CPU Vera y su GPU Rubin, y vino acompañado de cifras de eficiencia que son grandes, medidas enteramente por NVIDIA y todavía no revisadas por quien creó el benchmark que las produjo.
LPX no es un acelerador de propósito general ni pretende reemplazar a uno. Apunta a una sola etapa de la inferencia, y entender cuál es esa etapa es todo el sentido del producto.
Partir la inferencia en dos
Servir un modelo implica dos fases con apetitos de hardware opuestos. El prefill procesa el prompt y todo el contexto acumulado: está limitado por throughput, es masivamente paralelo y las GPU lo hacen bien. El decode emite la respuesta token por token, y cada token depende del anterior: está limitado por latencia y por ancho de banda de memoria, y es donde una GPU pasa buena parte del tiempo esperando en vez de calcular.
El planteo de NVIDIA es que los agentes volvieron cara esa asimetría. Un agente genera tokens a lo largo de cientos o miles de pasos, y una demora mínima por token se acumula en cada eslabón de la cadena. NVIDIA cita datos de OpenRouter según los cuales las cargas agénticas consumen 15 veces más tokens que un pedido de chat simple. Así que la empresa separó las dos fases en silicio distinto: las GPU Rubin del rack Vera Rubin NVL72 se ocupan del procesamiento de contexto a gran escala, y LPX se ocupa del decode sensible a la latencia. Un despliegue LPX a escala de rack puede llevar 256 aceleradores LP30 conectados por enlaces directos chip a chip, que según NVIDIA funcionan como un único procesador grande para inferencia determinista.
Es la misma idea de desagregación que los stacks de serving vienen persiguiendo por software hace rato. Lo que cambia es que ahora es un límite de hardware con una orden de compra adosada.
Los números, y quién los produjo
El resultado principal de NVIDIA es de 3.400 tokens de salida por segundo corriendo Gemma 4 31B con un contexto de 100.000 tokens, que atribuye a mediciones de Artificial Analysis y califica como el mejor desempeño jamás registrado para ese modelo. También afirma una capacidad de respuesta 4 veces mejor que lo que llama la plataforma alternativa más cercana, sin nombrar con qué compara.
Las cifras de eficiencia salen de otro posteo de NVIDIA y son las que más cuidado merecen. NVIDIA informa que Vera Rubin NVL72 entrega hasta 30 veces más throughput por megavatio y hasta 35 veces menor costo por millón de tokens que su propio GB300 NVL72, sobre el modelo DeepSeek V4 Pro, usando la carga AgentX de SemiAnalysis: sesiones reales de programación agéntica grabadas, conservando el crecimiento de contexto, las llamadas a herramientas y la creación de subagentes. Como referencia, NVIDIA ubica al GB300 NVL72 en hasta 15 veces más throughput por megavatio que Hopper en el mismo modelo.
Esas cifras vienen con cuatro salvedades, y la propia NVIDIA las enuncia todas:
- Los datos los midió NVIDIA, no SemiAnalysis, cuya carga de trabajo utiliza.
- Los resultados están, en palabras de NVIDIA, "pendientes de revisión por parte de SemiAnalysis".
- Todavía no reflejan el desempeño de la CPU Vera en llamadas a herramientas, una parte nada menor de cualquier loop agéntico real.
- La base de comparación es la generación anterior de la propia NVIDIA: es un reclamo generacional, no competitivo.
Un salto generacional de 30x en throughput por vatio sería raro si viniera solo de la arquitectura. Parte llega de otro lado del stack: NVIDIA dice que su gestión de energía DSX MaxLPS permite montar hasta 40% más GPU dentro del mismo presupuesto de megavatios. Conviene tomar el número como una cifra del fabricante sobre un test corrido por el fabricante, hasta que el autor del benchmark diga lo suyo.
El nombre de un competidor en la caja de NVIDIA
El detalle más raro está en la letra chica al pie del comunicado: "Groq y LPU se usan bajo licencia de Groq, Inc." NVIDIA está vendiendo un producto con la marca de la startup que durante años se posicionó como la alternativa de inferencia rápida frente a NVIDIA.
Eso viene del acuerdo de licencia reportado en torno a los 20.000 millones de dólares, por el cual NVIDIA tomó una licencia no exclusiva sobre la tecnología de inferencia de Groq y contrató a su fundador y CEO, Jonathan Ross. TechCrunch informó el 17 de agosto que Groq levantó desde entonces una Serie A de 350 millones a una valuación de 3.500 millones, por debajo de los 6.900 millones de septiembre de 2025, y se reconvirtió en neocloud corriendo sistemas NVIDIA en 13 centros de datos, con planes de pasar de 54 megavatios a más de 200 para 2027.
De ahí sale el cierre del propio anuncio de NVIDIA: después de Nebius, la primera nube en adoptar LPX, la que planea estar entre los primeros adoptantes es Groq. La empresa va a comprar racks de NVIDIA que llevan su propia marca licenciada. Sea lo que sea, es una ilustración nítida de cómo terminó la tesis del retador en inferencia.
Qué cambia para quien desarrolla
Hoy, nada. LPX es infraestructura a escala de rack que se le vende a nubes, y el primer despliegue es Nebius, que planea exponerlo a través de Nebius Token Factory. Danila Shtan, CTO de Nebius, subraya que llega "por la misma API que ya usan los desarrolladores, sin migrar a un stack nuevo": no hay SDK de LPX que aprender ni código que portar.
Lo que sí conviene seguir es el efecto de segundo orden. Si la aceleración de decode llega a nubes productivas a las velocidades que se afirman, el perfil de costo y latencia de los loops largos de agentes cambia más que el de una llamada de chat suelta, porque los agentes son intensivos en decode y la latencia de cada paso se acumula. Es justamente la carga en la que hoy se recorta alcance: menos subagentes, cadenas de razonamiento más cortas, menos contexto retenido. Una caída real en la latencia de decode por token aflojaría esas restricciones antes que hacer algo por un resumen de un solo tiro.
También refuerza una división ya visible en el ruteo de modelos. Si prefill y decode corren en silicio distinto con economías distintas, los proveedores tienen más motivos para cobrar la ingesta de contexto largo por separado de la generación, que es más o menos lo que ya hacen los precios escalonados de contexto y el prompt caching, ahora expresado en hardware.
Alrededor del anuncio
NVIDIA publicó un segundo comunicado la misma mañana: SpaceXAI va a desplegar CPU Vera de NVIDIA para la infraestructura de IA agéntica detrás de Grok. NVIDIA describe a Vera como su primera CPU diseñada para agentes, apuntada al trabajo limitado por CPU que rodea a la inferencia — ejecución de herramientas, corrida de código, procesamiento de datos y orquestación — con 88 núcleos Olympus de diseño propio, hasta 1,2 TB/s de ancho de banda de memoria y hasta 1,8 veces más velocidad para completar tareas que las CPU x86, otra vez según mediciones de NVIDIA. Mike Nicolls, presidente de SpaceXAI, lo plantea como dejar a "las GPU haciendo lo que mejor hacen" mientras la CPU absorbe la orquestación.
También se anunciaron Spectrum-X Multiplane, que según NVIDIA escala Ethernet a 512.000 GPU sin una tercera capa de red y conserva cerca del 90% del ancho de banda si falla un plano en una topología de ocho, ya en producción en CoreWeave; y NVLink Fusion, que conecta XPU y CPU personalizadas de terceros a la arquitectura de rack de NVIDIA. El hilo conductor es consistente: NVIDIA vende la fábrica entera, no el chip.
La inferencia es el motor de crecimiento de la IA. Vera Rubin extiende esa visión con configuraciones de fábrica de IA optimizadas por carga de trabajo y diseñadas para la era de la IA agéntica, corriendo la frontera de rendimiento con LPX para generación ultrarrápida de tokens.
Acá el argumento estratégico pesa más que el del silicio. NVIDIA sostiene que la inferencia ya es un problema de sistemas — contexto, red, orquestación y generación codiseñados juntos — y que ningún componente aislado lo resuelve. Es un argumento cómodo para el único proveedor que vende todos los componentes. También es, mirando dónde se traban de verdad las cargas agénticas, algo que no resulta evidentemente falso.
Por qué importa
- Lo que vuelve lentos y caros a los loops largos de agentes es la latencia de decode, no el throughput bruto. Dedicarle silicio a esa fase apunta justo al cuello de botella que obliga a acortar cadenas de razonamiento y recortar subagentes.
- Si prefill y decode corren en hardware separado con economías separadas, los proveedores ganan motivos para cobrar la ingesta de contexto largo aparte de la generación: el equivalente en hardware de los precios escalonados de contexto y el prompt caching.
- Las cifras de eficiencia principales las midió el fabricante sobre un benchmark ajeno y están explícitamente pendientes de revisión por ese tercero, lo que recuerda cuánto del debate actual sobre rendimiento en inferencia se apoya en datos de fabricante sin auditar.
Puntos clave
- Groq 3 LPX está en producción plena; acelera solo la fase de decode, mientras las GPU Rubin se ocupan del contexto. Un despliegue a escala de rack puede llevar 256 aceleradores LP30.
- NVIDIA cita mediciones de Artificial Analysis de 3.400 tokens de salida por segundo en Gemma 4 31B con 100K de contexto, y afirma 4 veces mejor respuesta que una alternativa cercana que no nombra.
- Los reclamos de 30x en throughput por megavatio y 35x en costo por token son contra el propio GB300 NVL72 de NVIDIA, medidos por NVIDIA sobre la carga AgentX de SemiAnalysis y pendientes de revisión de SemiAnalysis.
- Nebius es la primera en adoptarlo, vía Nebius Token Factory y la misma API que ya se usa. Groq, cuyas marcas NVIDIA licencia, planea estar entre los primeros adoptantes como cliente.
Fuentes
- NVIDIAFuente primariaNVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AInvidianews.nvidia.com
- GlobeNewswireFuente primariaNVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AIglobenewswire.com
- NVIDIAFuente primariaWith Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agentsblogs.nvidia.com
- NVIDIAFuente primariaUp to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agentsblogs.nvidia.com
- NVIDIAFuente primariaSpaceXAI Adopts NVIDIA Vera CPU to Accelerate Agentic AI at Massive Scalenvidianews.nvidia.com
- Hot ChipsFuente primariaHot Chips 2026 Advance Programhotchips.org
- TechCrunchGroq raises $350M to fuel its pivot from AI chips to neocloudtechcrunch.com
- nvidia
- groq
- inference
- ai-hardware
- agentic-ai
- inference-cost
- hot-chips
- coding-agents
- context-windows
- NVIDIA
- Groq
- Nebius
- SpaceXAI
- CoreWeave
- SemiAnalysis
- Artificial Analysis
- Gemma 4 31B
- DeepSeek V4 Pro