Promptea.
RegulaciónImportante

Anthropic dice que Claude ya lidera el 26% de su propia investigación

Anthropic publicó tres mediciones sobre cómo se construye la IA dentro de sus propias paredes: qué parte de su investigación lidera Claude, cómo supervisa una flota de 30.000 agentes y cuánto cómputo va a seguridad. Las cifras son de la empresa, y nadie de afuera las auditó.

Promptea Editorial7 min de lectura

Anthropic publicó el jueves tres mediciones que intentan poner números sobre algo que la industria venía discutiendo con adjetivos: qué tan rápido avanza realmente el desarrollo de IA de frontera, y cuánto de ese trabajo lo hace hoy la propia IA. El dato que va a circular es que Claude "lidera" el 26% del trabajo de I+D en IA de Anthropic en agosto de 2026, contra menos del 1% en febrero.

La publicación es tanto una propuesta como una divulgación. Anthropic sostiene que estas tres cosas deberían medirse y publicarse con regularidad en todos los laboratorios de frontera, y arrancó ella. Llega después del ensayo de su CEO Dario Amodei, We Must Pace the Frontier, publicado este mes, que pedía frenar el ritmo de avance en capacidades y comprometía a Anthropic a darles a evaluadores externos un acceso equivalente al de un empleado.

Las tres mediciones

En palabras de la propia empresa: "Compartimos tres mediciones que van a ayudar al público a seguir el desarrollo de IA dentro de los laboratorios de frontera: cuánto del I+D en IA lo hace la propia IA, qué tan bien se supervisan las acciones de los agentes, y cómo se asigna el cómputo."

  • I+D en IA liderado por IA — qué proporción de la investigación propia de la empresa la hacen sus modelos y no su gente.
  • Supervisión de agentes — qué tan completo es el monitoreo de lo que hacen los agentes internos, y con qué frecuencia interviene un monitor.
  • Asignación de cómputo — cómo se reparte el presupuesto de cómputo entre trabajo de seguridad y todo lo demás.

El objetivo declarado es achicar la distancia entre lo que saben los laboratorios y lo que sabe el resto. Los benchmarks de capacidad describen qué pueden hacer los modelos; esto pretende describir cómo se construyen.

De dónde sale el 26%

El número se apoya en una escala que Anthropic tomó prestada, no inventada. Usa una escala de automatización desarrollada por Epoch AI que mide un "Automation Level" (AL), de AL0 (sin intervención de IA) a AL5 (totalmente autónomo). En AL3 la IA "colabora": hace trabajo sustancial bajo dirección humana cercana. En AL4 la IA "lidera": completa la mayor parte de una tarea de punta a punta a partir de una instrucción general, con un humano supervisando.

El 26% es la proporción de trabajo en AL4 o más. La cifra más amplia se cita menos y probablemente diga más: "La proporción de trabajo en o por encima de 'la IA colabora' supera el 90%". Según su propia medición, casi toda la investigación en IA de Anthropic ya tiene un modelo involucrado de manera relevante; lo discutible es cuánto de eso lo conduce el modelo.

Anthropic llama a la construcción Anthropic R&D Automation Index y la describe como un prototipo. Armarlo implicó catalogar los tipos de trabajo de la empresa en un árbol jerárquico congelado de tareas: "El árbol resultante tiene 542 nodos a distintas profundidades, de los cuales 378 son hojas como 'diagnóstico y corrección de defectos de la plataforma de evals', 'egress y política de red del sandbox de RL' e 'informes post mortem de incidentes de serving'". Después, agentes de investigación Claude muestrean registros de trabajo del personal para listar tareas, un modelo juez Claude independiente le asigna a cada una un nivel de automatización a partir de la evidencia reunida, y las calificaciones se agregan ponderando por tiempo-persona, repartiendo la semana de cada uno en partes iguales entre sus tareas.

Conviene retener dos cosas de ese circuito. Claude hace buena parte de la calificación de cuánto trabajo hace Claude, algo que Anthropic explicita pero que sigue siendo una dependencia real. Y la ponderación por tiempo-persona mide la proporción de *categorías de tareas* cubiertas, no la de producto, valor o dificultad: una tarea que Claude lidera y una en la que no puede ayudar pesan según cuánto tiempo humano consumen, no según cuánto importan.

30.000 agentes, y qué los frena de verdad

La sección de supervisión es la que más detalle aprovechable trae. En agosto de 2026, Anthropic reporta alrededor de 30.000 agentes haciendo trabajo de investigación e ingeniería al mismo tiempo en su plataforma interna más usada. Los vigilan dos capas.

Los monitores en línea revisan las acciones de los agentes en tiempo real y bloquean acciones peligrosas o corrigen desvíos de forma automática. Anthropic analizó más de mil millones de decisiones de sus agentes de investigación e ingeniería durante agosto de 2026 y encontró que el 0,002% —cerca de 1 de cada 47.000— fue bloqueado por ese monitor.

Los monitores fuera de línea leen la actividad después de ocurrida. Esa capa "marca aproximadamente una o dos transcripciones de cada mil para revisión adicional", unas 100.000 transcripciones por semana según la propia empresa. La mayoría se resuelve automáticamente con una batería de clasificadores que filtra falsos positivos, y sólo las marcas de máxima prioridad —"aproximadamente ~50 por semana"— llegan a una persona.

Una tasa de bloqueo de 1 en 47.000 se puede leer de dos maneras, y Anthropic no elige por el lector. Puede significar que los agentes rara vez intentan algo peligroso. O que el monitor detecta una franja angosta de cosas. La propia advertencia de la empresa es que a esta escala "es difícil tener certeza de que tenemos un panorama completo de todos los tipos posibles de comportamiento", y plantea que los desarrolladores deberían publicar con qué frecuencia se detecta el mal comportamiento *conocido*, y que terceros corran esa prueba de forma independiente.

Seis por ciento a seguridad

En la semana que Anthropic examinó —del 13 al 20 de julio de 2026— cerca del 6% del cómputo destinado a I+D en IA se asignó a seguridad, y alrededor del 12% del cómputo destinado específicamente a I+D en IA conducido por IA fue a seguridad.

La empresa señala ella misma el problema evidente de esta métrica, lo que juega a su favor: "La investigación en seguridad es difícil de distinguir de la investigación en capacidades, y cada desarrollador va a tener la tentación de trazar la línea con generosidad". También aclara que una proporción de cómputo mide sólo lo que se gasta, y no dice nada sobre eficiencia ni sobre cuánto trabajo produjo ese gasto. Un laboratorio podría reducir a la mitad su cómputo de seguridad volviéndolo más eficiente y quedar peor parado.

Autoinformado, y por ahora sin pares

Ninguno de estos números fue auditado por nadie fuera de Anthropic. La empresa dice que quiere cambiar eso: "Planeamos incorporar evaluadores independientes de múltiples organizaciones dentro de Anthropic, y darles acceso a procesos, sistemas y datos internos comparable al que tienen los equipos internos de evaluación de riesgos". Eso es un plan, no un acuerdo en funcionamiento, y hasta que exista las cifras son el relato que una empresa hace de sí misma.

El peso de la propuesta depende por completo de si alguien más la sigue. El argumento de Anthropic es que "cualquier desarrollador de frontera podría publicar estas medidas con regularidad, usando una metodología pública". Ningún otro laboratorio publicó cifras comparables, y un régimen de medición que una sola empresa reporta sobre sí misma se parece más a la divulgación que a la rendición de cuentas.

Además aterriza en una discusión realmente disputada. Una nota del mismo día en TechCrunch expone el argumento de que el impulso por frenar el ritmo favorece a los que ya están adentro: cita al CEO de Cohere describiendo a los grandes laboratorios como "un cartel" que escribe reglas que les convienen, y señala que la disputa de fondo es "quién las escribe, quién participa". Publicar las propias métricas es una respuesta razonable a esa acusación, o una extensión de ella, según quién termine definiendo las categorías.

Si vos corrés agentes

Acá no hay un cambio de prompting, pero sí una arquitectura de referencia, y es inusualmente concreta para algo que un laboratorio de frontera puso en público. La forma es cobertura total en las dos capas —un monitor en tiempo real con autoridad para bloquear o redirigir, más un lector posterior sobre todo lo que pasó— con un embudo barato de clasificadores en el medio cuyo único trabajo es mantener chica la cola humana. Lo interesante es la proporción: unas 100.000 marcas automáticas por semana comprimidas a unos 50 ítems que alguien mira de verdad.

Si corrés agentes de código a cualquier escala, ahí tenés el intercambio explicitado. La capacidad de revisión es el insumo fijo, y todo lo que está aguas arriba existe para gastarla bien.

Por qué importa

  • Es la primera vez que un laboratorio de frontera pone un número público sobre cuánto de su propia investigación la hacen sus modelos, que es justamente el dato que le faltaba a toda la discusión sobre el ritmo del desarrollo de IA.
  • Las cifras de supervisión describen en términos concretos un esquema de monitoreo real para una flota de 30.000 agentes —cobertura, tasas de marcado y cuánto llega a una persona—, un nivel de detalle público poco frecuente para quien construye con agentes.
  • La propuesta sólo se vuelve rendición de cuentas si los competidores la adoptan y evaluadores externos la verifican. Hoy es una empresa reportando sobre sí misma, y Anthropic enumera las formas en que eso puede fallar.

Puntos clave

  • Claude 'lidera' el 26% del trabajo de I+D en IA de Anthropic en agosto de 2026, contra menos del 1% en febrero; más del 90% de ese trabajo está en 'la IA colabora' o por encima, según la escala de automatización de Epoch AI.
  • El índice es un prototipo armado sobre un árbol de 542 nodos de tareas, con un modelo juez Claude asignando niveles de automatización y resultados ponderados por tiempo-persona: es decir, Claude calificando en buena medida a Claude.
  • Sobre más de mil millones de decisiones de agentes en agosto de 2026, los monitores en tiempo real bloquearon el 0,002% (cerca de 1 de cada 47.000); los monitores fuera de línea marcan 1 o 2 transcripciones cada mil, de las cuales unas 50 por semana llegan a una persona.
  • Cerca del 6% del cómputo de I+D en IA fue a seguridad en la semana del 13 al 20 de julio de 2026; Anthropic advierte que la línea entre seguridad y capacidades es una que todo desarrollador tiene la tentación de trazar con generosidad.
  • Anthropic dice que planea incorporar evaluadores independientes con acceso de nivel interno, pero ese esquema todavía no existe y ningún otro laboratorio publicó medidas comparables.

Fuentes

  1. AnthropicFuente primaria
    Measurements for understanding the pace of AI development inside frontier labs
    anthropic.com
  2. Dario AmodeiFuente primaria
    We Must Pace the Frontier
    darioamodei.com
  3. TechCrunch
    Is the AI safety debate about safety or control?
    techcrunch.com
Etiquetas:
  • transparency
  • ai-r-and-d-automation
  • agent-oversight
  • compute-allocation
  • pacing-the-frontier
  • third-party-evaluators
  • automation-levels
Empresas:
  • Anthropic
  • Epoch AI
  • Cohere
Modelos:
  • Claude

Recibí Promptea Semanal en tu email

Un email cada lunes — las mejores historias de IA de la semana, verificadas y resumidas.

Anthropic: Claude lidera el 26% de su propia I+D · Promptea