Promptea.
Lanzamiento de modeloImportante

SpaceXAI lanza Grok 4.6: mismo precio que 4.5 y resultados mixtos en sus propios benchmarks

El nuevo modelo apunta a agentes de larga duración y mantiene el precio de lista de Grok 4.5, USD 2/USD 6. Todas las cifras de benchmarks son de SpaceXAI, y dos de ellas dejan a Grok 4.6 por detrás de GPT-5.6 Sol Max y Fable 5 Max en código agéntico.

Promptea Editorial6 min de lectura

SpaceXAI lanzó Grok 4.6 el 12 de agosto, una continuación de Grok 4.5 que la empresa posiciona alrededor de los agentes de larga duración — trabajo que tiene que sostenerse a lo largo de muchos pasos, ya sea recorrer un codebase, investigar un tema desconocido o llevar una idea de producto a una primera versión funcionando — y de la salida interactiva y visual. El precio de lista no cambia respecto de Grok 4.5: USD 2 por millón de tokens de entrada y USD 6 por millón de tokens de salida.

Todos los números de rendimiento publicados con el lanzamiento son de la propia SpaceXAI. Conviene tenerlo presente, porque la tabla de benchmarks del anuncio es la parte más informativa, y no se lee del todo a favor de la empresa.

Qué afirma el lanzamiento

La afirmación central es la paridad en el Artificial Analysis Intelligence Index, que SpaceXAI describe como un compuesto de nueve benchmarks. Grok 4.6 obtiene 61 ahí, empata con GPT-5.6 Sol Max en 61 y queda un punto por debajo de Fable 5 Max, que marca 62. Grok 4.5 High había obtenido 56, así que el salto sobre su propio antecesor es de cinco puntos. Dicho sin adornos: es una afirmación de igualar al modelo de OpenAI más fuerte de la propia comparación de SpaceXAI y de seguir por detrás del de Anthropic, no de liderar el campo. La tabla tiene cuatro columnas, dos de ellas modelos de la propia SpaceXAI: es una comparación seleccionada, no un leaderboard.

En las evaluaciones donde la tabla de SpaceXAI lo pone adelante, los márgenes son en general estrechos:

  • GDPVal-AA v2: 1753, contra 1741 de Fable 5 Max, 1728 de GPT-5.6 Sol Max y 1526 de Grok 4.5 High.
  • AA-Briefcase: 1577, contra 1574 de Fable 5 Max y 1502 de GPT-5.6 Sol Max.
  • Harvey LAB (Vals): 15,8%, contra 11,3% de Fable 5 Max y 2,5% de GPT-5.6 Sol Max.
  • CursorBench v3.2: 69,9%, por delante de GPT-5.6 Sol Max con 67,2% pero por detrás de Fable 5 Max con 70,5%.

Dónde sus propios números lo dejan atrás

La misma tabla muestra a Grok 4.6 perdiendo en las dos evaluaciones que más se parecen al trabajo de agente prolongado para el que se lo vende. En DeepSWE v1.1 obtiene 65,9%, contra 73% de GPT-5.6 Sol Max y 70% de Fable 5 Max. En Terminal-Bench v3.0 obtiene 26%, contra 34,6% y 34,1%. También queda por detrás de Fable 5 Max en FrontierCode v1.1 Extended (61,3% contra 63,6%), APEX-Agents (57,5% contra 59,2%) y APEX-SWE (56,4% contra 58,8%).

Publicar una tabla en la que perdés en varias filas es mejor práctica que la alternativa, y ese crédito le corresponde a SpaceXAI. Pero implica que la paridad es un resultado a nivel de índice y no algo que sobreviva evaluación por evaluación. Un modelo presentado como especialista en agentes que siguen trabajando durante muchos pasos queda, según su propia medición, unos ocho puntos por detrás en el benchmark de terminal.

Hay una segunda advertencia en la letra chica. SpaceXAI aclara que las cifras de la competencia salen de las system cards o los leaderboards publicados por los otros desarrolladores, y que son "lo mejor de los resultados autoinformados o públicamente disponibles". Eso no es una comparación controlada: los puntos de referencia se produjeron con distintos harnesses, con distintos niveles de esfuerzo de razonamiento y en distintas fechas. Una tabla comparativa armada así indica una franja aproximada, no un ranking confiable al decimal.

Lo que sí aparece en tu factura de API

La documentación pública de modelos de SpaceXAI trae los detalles que importan más que el puntaje del índice si de verdad vas a poner esto en producción. Grok 4.6 tiene una ventana de contexto de 500.000 tokens, pero la documentación fija un umbral de contexto largo en 200.000 tokens, y pasado ese límite las tarifas se duplican: la entrada va de USD 2 a USD 4 por millón y la salida de USD 6 a USD 12. La ventana que podés usar sin cambio de precio es de 200K, no de 500K. Para loops de agentes que van acumulando transcripción, salida de herramientas y contenido de archivos, ese umbral es el número que conviene instrumentar.

Hay otros dos detalles fáciles de pasar por alto:

  • La entrada cacheada figura a USD 0,50 por millón (USD 1,00 en la banda de contexto largo). La misma documentación lista la entrada cacheada de Grok 4.5 a USD 0,30 por millón, así que los aciertos de caché se encarecieron aunque las tarifas principales quedaron planas.
  • El esfuerzo de razonamiento por defecto es high. Los valores soportados son low, medium, high y xhigh; en un modelo de razonamiento, el esfuerzo se traduce en tokens de salida facturados, así que el default es el caro. Grok 4.3, en cambio, viene por defecto en low y permite apagar el razonamiento del todo.
  • El descuento por batch documentado para Grok 4.6 es 0%, contra 20% para Grok 4.3.
  • Soporta function calling y structured outputs, y el anuncio menciona una variante fast al doble de precio.

En conjunto, el precio plano es real pero parcial. Los mismos USD 2/USD 6 que Grok 4.5, caché más cara, sin descuento por batch, un salto de costo a los 200K tokens y un default que gasta más tokens de razonamiento de los que quizá tenías pensado.

Disponibilidad

Grok 4.6 está disponible desde hoy en Cursor y en Grok Build, la herramienta propia de SpaceXAI, a través de la API y vía OpenRouter, Vercel y Cloudflare. SpaceXAI ofrece el doble de uso incluido dentro de Grok Build y Cursor durante la primera semana: un subsidio de prueba que vence, y que conviene dejar afuera de cualquier modelo de costos que armes esta semana.

Sobre el entrenamiento, el anuncio dice que Grok 4.6 tuvo una corrida de entrenamiento suplementario más larga que Grok 4.5, con datos curados generados por modelo y un optimizador y una receta mejorados; que se usó Grok 4.5 para regenerar las trayectorias de fine-tuning supervisado; y que el aprendizaje por refuerzo cubrió tareas agénticas que incluyen optimización de kernels, desarrollo web y diseño asistido por computadora. La sección de seguridad describe la batería de pruebas previas al despliegue más amplia de la empresa hasta la fecha más pruebas de terceros, sin nombrar a esos terceros ni publicar resultados.

Lo que no pudimos verificar

No pudimos abrir ninguna evaluación independiente de Grok 4.6. Artificial Analysis — el evaluador sobre cuyo índice descansa la afirmación de paridad — junto con OpenRouter, el propio posteo de Cursor y varios medios que cubrieron el lanzamiento resultaron inalcanzables desde nuestro entorno, ya sea bloqueados a nivel de red o detrás de desafíos anti-bot que no vamos a esquivar. Esta nota se apoya entonces en el anuncio de SpaceXAI y en su documentación pública de modelos, ambas fuentes de la empresa.

Tomá el 61 del Intelligence Index como una afirmación de SpaceXAI y no como un resultado establecido, hasta que un tercero publique su propia corrida. El precio, la ventana de contexto, el comportamiento del umbral y los flags de funcionalidad están mejor parados: salen de la documentación de API que la empresa tiene que honrar al facturar.

Si estás eligiendo modelo para un loop de agentes, las diferencias concretas son el mismo precio de lista que Grok 4.5, un salto de costo a los 200K dentro de una ventana de 500K, un esfuerzo de razonamiento alto por defecto, cero descuento por batch y una tabla del propio fabricante que lo deja atrás en las dos evaluaciones de código más parecidas a trabajar en una terminal. Alcanza para justificar probarlo contra tus propias tareas. No alcanza para migrar por un número de índice.

Por qué importa

  • Un modelo de nivel frontera que llega al precio de lista de su antecesor cambia el cálculo de costos para agentes de código, pero solo si también contás el umbral de 200.000 tokens donde las tarifas de entrada y salida se duplican dentro de la ventana de 500.000.
  • La propia tabla comparativa de SpaceXAI muestra a Grok 4.6 por detrás de GPT-5.6 Sol Max y Fable 5 Max en DeepSWE y Terminal-Bench, las evaluaciones más cercanas al trabajo de agente prolongado para el que se lo promociona.
  • Los defaults pesan tanto como las tarifas: un esfuerzo de razonamiento alto por defecto, entrada cacheada a USD 0,50 por millón y 0% de descuento por batch empujan el gasto real por encima de lo que sugiere el titular de USD 2/USD 6.

Puntos clave

  • Grok 4.6 se lanzó el 12 de agosto, enfocado en agentes de larga duración y en salida interactiva o visual.
  • Obtiene 61 en el Artificial Analysis Intelligence Index según la tabla de SpaceXAI, empatando con GPT-5.6 Sol Max (61) y por detrás de Fable 5 Max (62); Grok 4.5 High marcó 56.
  • El precio de lista se mantiene en USD 2 por millón de entrada y USD 6 de salida, pero se duplica a USD 4 y USD 12 por encima de un umbral de 200.000 tokens; la ventana de contexto es de 500.000 tokens.
  • La entrada cacheada cuesta USD 0,50 por millón contra los USD 0,30 listados para Grok 4.5, el descuento por batch es 0% y el esfuerzo de razonamiento por defecto es alto.
  • Los propios números de SpaceXAI lo dejan atrás en DeepSWE v1.1 (65,9% contra 73%) y Terminal-Bench v3.0 (26% contra 34,6%); no hubo evaluación independiente alcanzable.

Fuentes

  1. SpaceXAIFuente primaria
    Introducing Grok 4.6
    x.ai
  2. SpaceXAIFuente primaria
    Models — SpaceXAI Docs
    docs.x.ai
Etiquetas:
  • grok
  • model-release
  • coding-agents
  • api-pricing
  • context-window
  • benchmarks
Empresas:
  • SpaceXAI
  • OpenAI
  • Anthropic
  • Cursor
Modelos:
  • Grok 4.6
  • Grok 4.5
  • Grok 4.3
  • GPT-5.6 Sol Max
  • Fable 5 Max
Grok 4.6: mismo precio que 4.5 y benchmarks propios · Promptea