Salesforce construyó su propio modelo de razonamiento sobre pesos abiertos de NVIDIA
Koa surge de un post-entrenamiento de Nemotron-3-Super-120B y entra en Agentforce como alternativa a los modelos frontera alquilados. El informe técnico que lo acompaña es inusualmente franco sobre dónde queda parado.
Salesforce abrió Dreamforce en San Francisco este martes con un modelo propio. Koa es un modelo de lenguaje empresarial post-entrenado a partir del Nemotron-3-Super-120B de NVIDIA, de pesos abiertos, y va a ofrecerse dentro de la plataforma Agentforce como alternativa a los modelos frontera que Salesforce hoy le alquila a otros proveedores. Junto con el anuncio se publicó un informe técnico de 16 páginas, y es el más interesante de los dos documentos: porque incluye una tabla de benchmarks que no favorece al lanzamiento.
El resumen del propio informe es la descripción más clara disponible: Koa "mejora sobre su base de pesos abiertos, con las ganancias más nítidas en uso de herramientas multi-turno, y supera a una línea de base propietaria fuerte, aunque permanece por debajo de los modelos frontera más potentes". Es una afirmación más acotada que el encuadre del anuncio, y conviene tomarla literalmente.
Qué es Koa
Koa parte del Nemotron-3-Super-120B de NVIDIA, un checkpoint de pesos abiertos publicado en marzo bajo la NVIDIA Nemotron Open Model License. La model card describe una arquitectura híbrida de mezcla latente de expertos — capas Mamba-2 y MoE intercaladas, más algunas de atención — con 120 mil millones de parámetros totales y 12 mil millones activos por token, y una ventana de contexto de hasta un millón de tokens. La baja cantidad de parámetros activos es lo que importa comercialmente: es lo que vuelve plausible correr un modelo de 120B por cuenta propia frente a pagar llamadas por token a un laboratorio frontera.
Salesforce post-entrena esa base con Group Relative Policy Optimization, el método de aprendizaje por refuerzo que popularizó DeepSeek-R1. El informe afirma que el entrenamiento usó solamente datos públicos y generados sintéticamente, sin datos de clientes — una afirmación que la empresa va a tener que sostener, y que resulta más fácil de hacer cuando las tareas de entrenamiento son simuladas en lugar de recolectadas. El entrenamiento corrió sobre un clúster Slurm de cinco nodos NVIDIA B200, con el diseño de recompensa resuelto primero en un modelo Nemotron Nano de unos 30B, más barato, antes de portarlo a la política de 120B.
La tabla de benchmarks, completa
Salesforce evaluó a Koa contra su propia base y tres modelos propietarios, en dos benchmarks públicos de llamadas a herramientas y uno empresarial propio. Los números, tal como fueron publicados:
- Tau2Bench (atención al cliente multi-turno, promedio ponderado por tareas): Koa 69,41; Nemotron-3-Super-120B 68,64; GPT-4.1 54,48; Claude Opus 4.8 74,00; GPT-5.5 83,99.
- BFCL (uso agéntico de herramientas): Koa 66,63%; base 64,73%; GPT-4.1 53,96%; GPT-5.5 67,63%; Claude Opus 4.8 78,18%.
- CRM Bench (flujos de trabajo de Salesforce y Agentforce, promedio ponderado): Koa 0,86; base 0,84; GPT-4.1 0,81; Claude Opus 4.8 0,87; GPT-5.5 0,90.
- Precisión en llamadas a funciones de CRM Bench, la mejora individual más clara: Koa 0,77 contra 0,71 del modelo base.
Si leés esa tabla sin el comunicado, saltan tres cosas. El margen sobre la base de pesos abiertos es de menos de un punto en Tau2Bench y de unos dos puntos en BFCL: real, reproducible y modesto. El margen sobre GPT-4.1 es grande, pero GPT-4.1 es un modelo de 2025 y no es sobre lo que nadie está desplegando agentes hoy. Y en los tres benchmarks, incluido el que Salesforce construyó y puntuó por su cuenta, un modelo frontera actual sigue adelante.
El método es lo que vale la pena copiar
Lo que distingue al trabajo no es el puntaje sino de dónde salen los datos de entrenamiento. Los agentes de Agentforce se configuran en Agent Script, el lenguaje declarativo de Salesforce para describir el enrutador de un agente, sus subagentes, sus acciones tipadas, los alcances de herramientas y las instrucciones de flujo de trabajo. Salesforce compila esas mismas especificaciones en un grafo de flujo tipado — esquemas de argumentos, efectos de estado declarados, condiciones de enrutamiento, reglas de terminación — y lo instancia como un entorno simulado ejecutable, con estado que las herramientas leen y modifican.
Una tubería de simulación expande cada especificación en sesiones multi-turno condicionadas por escenario y por persona, ejecutadas como rollouts en línea dentro de NeMo Gym de NVIDIA, con recompensas ancladas en si el modelo efectivamente resolvió la tarea mediante el uso correcto de herramientas y no en si su texto quedó lindo. Para los dominios públicos de uso de herramientas, donde no existe una especificación en Agent Script, Salesforce sintetiza un grafo equivalente para que la misma maquinaria maneje ambos casos.
La consecuencia es un circuito directo entre la autoría de agentes y el post-entrenamiento del modelo: el artefacto que un cliente escribe para configurar un agente es el mismo que genera las tareas de entrenamiento y define la recompensa. Cualquier proveedor con un formato declarativo de agentes — y ya son varios — tiene ese mismo circuito a mano.
Por qué una empresa de aplicaciones quiere un modelo de razonamiento
Construimos muchos modelos de lenguaje chicos y específicos por tarea, que forman parte del portafolio de Agentforce. Pero el razonamiento siempre fue algo para lo que dependimos de los proveedores de modelos frontera. Hasta ahora.
Ese es el punto estructural. Un proveedor de aplicaciones que enruta cada turno de agente a un laboratorio externo paga por token, hereda las restricciones de despliegue de ese laboratorio y tiene que explicarle el recorrido de los datos a clientes regulados. Tener un modelo especializado propio cambia la aritmética en los tres frentes, aun si el modelo es más débil en abstracto — porque las tareas que tiene que hacer no son abstractas. Kari Ann Briski, VP de software de IA generativa para empresas en NVIDIA, le resumió el atractivo a TechCrunch como "IA soberana, tiempo hasta el primer token, razonamiento eficiente, por la tokenómica de todo esto".
Lo que no se dijo
Salesforce no informó si los pesos de Koa van a publicarse, cuánto va a costar dentro de Agentforce ni cuándo estará disponible de forma general; TechCrunch reporta solamente que se ofrecerá como alternativa a los otros modelos de la plataforma. La afirmación sobre eficiencia de tokens — que Koa consume menos tokens que enrutar a un modelo frontera para el mismo trabajo — es de la empresa, y en el informe técnico no aparece ninguna medición que la respalde.
El informe también señala su propia limitación principal: como el Nemotron-3-Super-120B ya viene post-entrenado con aprendizaje por refuerzo, el hallazgo de Salesforce de que el RL le gana al ajuste fino supervisado en uso de herramientas multi-turno podría no sostenerse partiendo de un checkpoint previo al RL. Los autores lo dicen explícitamente en lugar de generalizar. Y CRM Bench, el benchmark donde Koa queda más cerca del desempeño frontera, es de Salesforce: evaluación de local, puntuada de local.
Nada de eso vuelve menos significativo al lanzamiento. La afirmación que vale la pena seguir no es que Koa le gane a alguien. Es que una base de pesos abiertos con 12 mil millones de parámetros activos, especializada con las propias especificaciones de agentes de una empresa, queda lo bastante cerca en el conjunto acotado de tareas que esa empresa efectivamente vende. Si eso se reproduce fuera de la evaluación propia de Salesforce, el número interesante no está en la tabla de benchmarks: es el tamaño de la factura que deja de irse a un laboratorio frontera.
Por qué importa
- Es la primera vez que el mayor proveedor de aplicaciones empresariales dice públicamente que ya no necesita comprarle razonamiento a un laboratorio frontera para su propia plataforma de agentes — un cambio en dónde queda el valor, y el gasto, dentro del stack de IA empresarial.
- El método de post-entrenamiento convierte automáticamente la configuración de un agente escrita por el cliente en tareas de entrenamiento y recompensas, lo que abarata la especialización para cualquiera que ya tenga un formato declarativo de agentes.
- La tabla de benchmarks publicada fija una vara honesta sobre lo que hoy compra especializar un modelo de pesos abiertos: una ventaja cómoda sobre los modelos propietarios de la generación anterior, y una distancia persistente con la frontera actual.
Puntos clave
- Koa es un post-entrenamiento con GRPO del Nemotron-3-Super-120B de NVIDIA (120B totales, 12B activos), sobre datos públicos y sintéticos, sin datos de clientes.
- Mejora a su base en menos de un punto en Tau2Bench y unos dos puntos en BFCL, le gana a GPT-4.1 por márgenes amplios, y queda detrás de Claude Opus 4.8 y GPT-5.5 en los tres benchmarks que corrió Salesforce.
- La novedad es el RL guiado por especificaciones: las definiciones de agentes en Agent Script se compilan en entornos simulados cuyas recompensas se anclan en el uso exitoso de herramientas.
- El entrenamiento corrió sobre cinco nodos NVIDIA B200, con la receta de recompensa desarrollada primero en un Nemotron Nano de unos 30B.
- No se informaron precios, fecha de disponibilidad ni publicación de pesos; la afirmación sobre eficiencia de tokens es de la empresa y no está medida en el informe técnico.
Fuentes
- arXivFuente primariaSalesforce Koa: An Enterprise Language Model for Agentic Tool Usearxiv.org
- TechCrunchSalesforce and Nvidia's new reasoning model is everything the AI labs should feartechcrunch.com
- NVIDIA on Hugging FaceFuente primariaNVIDIA-Nemotron-3-Super-120B-A12B-FP8 model cardhuggingface.co
- agentic-tool-use
- open-weight-models
- grpo
- enterprise-ai
- agentforce
- nemotron
- post-training
- Salesforce
- NVIDIA
- OpenAI
- Anthropic
- Salesforce Koa
- Nemotron-3-Super-120B
- GPT-4.1
- GPT-5.5
- Claude Opus 4.8