Promptea.
RegulaciónImportante

El primer evaluador embebido de Anthropic es Accenture, y lo paga Anthropic

Cada parte compromete al menos USD 1.000 millones en cinco años para meter evaluadores externos dentro de Anthropic con acceso de nivel empleado. El evaluador es una consultora que ya le vende Claude a empresas.

Promptea Editorial5 min de lectura

Anthropic anunció el viernes que Accenture va a ser la primera firma externa en ubicar evaluadores dentro de la empresa, con un acceso que describe como equivalente al de un empleado. Cada compañía espera invertir al menos USD 1.000 millones en desarrollar capacidad para este trabajo durante los próximos cinco años. Es la primera implementación concreta de un compromiso que el CEO de Anthropic había asumido seis días antes, y la elección del socio ya es la parte más discutida del asunto.

El trabajo va a estar liderado por Faculty, la firma de IA aplicada que Accenture compró, y abarca evaluar y hacer red-teaming de modelos, realizar evaluaciones de alineamiento y poner a prueba las salvaguardas. Anthropic dice que los evaluadores embebidos van a poder observar cómo se forman los modelos durante el entrenamiento, seguir las decisiones que rigen cómo se construyen y se despliegan, y hablar directamente con los empleados — para después reportar incidentes y dar al público una versión de lo que encuentren. En el comunicado conjunto de las empresas, Marc Warner, CTO de Accenture y CEO de Faculty, resumió la premisa sin vueltas.

La IA debería ser segura por diseño, no segura por accidente.

Marc Warner, CTO de Accenture y CEO de Faculty

De dónde viene el compromiso

El 12 de septiembre, Dario Amodei publicó We Must Pace the Frontier, un ensayo que sostiene que los laboratorios de frontera deberían frenar deliberadamente el avance de capacidades para que el trabajo de seguridad, la evaluación y la coordinación puedan alcanzarlo. Plantea tres pasos. El primero — los evaluadores embebidos — es el que Anthropic dijo que iba a adoptar de manera unilateral, y Amodei lo llamó "el paso clave para la verificabilidad de cualquier compromiso de pacing".

Dos detalles de ese ensayo importan ahora. El evaluador que mencionaba como ejemplo era METR, una organización sin fines de lucro. El antecedente que citaba era la supervisión bancaria, donde los reguladores a veces trabajan embebidos junto al personal de la propia entidad. El anuncio del viernes no nombró ni a una organización sin fines de lucro ni a un regulador. TechCrunch informó que la elección sorprendió a observadores que esperaban a METR, Redwood Research o Apollo Research, y que hubo críticas que lo leyeron como la industria controlándose a sí misma.

La pregunta por la independencia, que la propia Anthropic plantea

Anthropic financia el trabajo de Accenture de forma directa. La empresa es llamativamente explícita en que este no es el esquema que cree que debería perdurar: dice que el financiamiento de largo plazo de la evaluación independiente debería venir de fondos mancomunados o estatales, como planteó en su Advanced AI Framework en junio, y que hoy no existe ninguno de los dos. También dice que todavía no hay estándares sobre a qué información deberían acceder los evaluadores embebidos ni sobre cómo deberían reportar lo que encuentran.

Esa franqueza merece reconocimiento, y aun así no disuelve el problema. La analogía bancaria funciona justamente porque a los supervisores les paga el Estado y no el banco supervisado. Un evaluador pagado por el laboratorio que evalúa, operando bajo reglas que todavía no se escribieron, es otro instrumento: se parece más a una auditoría encargada que a una supervisión. La respuesta de Anthropic es que los evaluadores embebidos "no reducen nuestra responsabilidad, sino que ayudan a hacerla más verificable", y que la seguridad de sus modelos sigue siendo asunto suyo.

Hay un segundo enredo, y sale del anuncio de las propias empresas antes que de los críticos. Accenture no es un tercero neutral que llega de cero. El comunicado menciona una alianza comercial plurianual ya existente entre ambas, anunciada hace unos nueve meses, orientada a expandir el uso empresarial de Claude. La firma que va a evaluar las prácticas de seguridad de Anthropic también les vende los modelos de Anthropic a sus clientes.

Qué haría que esto signifique algo

El anuncio es una estructura, todavía no un resultado. Unas pocas cosas van a mostrar si se trata de un control independiente o de una consultoría bien paga:

  • Si los evaluadores pueden publicar hallazgos que Anthropic preferiría que no publicaran, y bajo qué reglas.
  • Si el acceso de nivel empleado sobrevive al desacuerdo: lo que se concede de forma voluntaria también se puede recortar de forma voluntaria.
  • Si los pilotos con METR y otras organizaciones sin fines de lucro, financiados por ellas mismas, efectivamente se concretan.
  • Si otros laboratorios de frontera siguen el camino, o si el paso unilateral de Anthropic queda siendo unilateral.
  • Si el financiamiento alguna vez se mueve hacia las fuentes mancomunadas o públicas que Anthropic dice preferir.

Anthropic dice que la alianza no es exclusiva, que está en diálogo con METR y otros evaluadores sin fines de lucro para pilotear elementos de evaluación embebida con financiamiento propio de esas organizaciones, y que en las próximas semanas va a anunciar más evaluadores. Se espera que Accenture trabaje con otros desarrolladores de IA en capacidades similares. Esos anuncios posteriores van a decir más que este. Las acciones de Accenture subieron el viernes en el mercado posterior al cierre, lo que ya es un comentario sobre cómo leyó el mercado un contrato de evaluación de seguridad.

Para quienes construyen sobre estos modelos

Esta semana no cambia nada. Acá no hay superficie de API, ni actualización de modelo, ni implicancia de precios. Lo que conviene mirar a más largo plazo es la divulgación. Si los evaluadores embebidos terminan analizando los pipelines de entrenamiento y reportando incidentes, en vez de solo calificar modelos terminados, el beneficio práctico para quienes usan la API sería mejor información sobre por qué un modelo salió cuando salió y contra qué se probaron realmente sus salvaguardas. Eso sería genuinamente útil. Nada de eso queda garantizado por lo que se anunció el viernes.

Por qué importa

  • Es la primera prueba concreta de la evaluación embebida, el mecanismo que el CEO de Anthropic propuso seis días antes como la clave para hacer verificable cualquier compromiso de pacing.
  • Al evaluador lo financia la empresa que evalúa, bajo reglas que todavía no existen, y ya tiene con ella una relación comercial. Si eso constituye o no un control independiente es la pregunta abierta.
  • Si funciona, el efecto para quienes desarrollan es mejor divulgación sobre cómo se prueban los modelos y por qué salen. Si no, es una partida de gasto con etiqueta de seguridad.

Puntos clave

  • Anthropic designó a Accenture, vía su unidad Faculty, como su primer evaluador embebido el 18 de septiembre; cada empresa espera invertir al menos USD 1.000 millones en cinco años.
  • Los evaluadores reciben un acceso que Anthropic describe como equivalente al de un empleado: modelos durante el entrenamiento, decisiones de construcción y despliegue, y contacto directo con el personal.
  • Anthropic financia el trabajo de forma directa, aunque sostiene que debería financiarse con fondos mancomunados o estatales; todavía no hay estándares de acceso ni de reporte.
  • La alianza no es exclusiva: Anthropic dice estar en diálogo con METR y otras organizaciones sin fines de lucro, y anunciará más evaluadores en las próximas semanas.

Fuentes

  1. AnthropicFuente primaria
    Partnering with Accenture on embedded evaluation
    anthropic.com
  2. Business Wire (via Yahoo Finance)Fuente primaria
    Accenture and Anthropic Partner to Build Team of Embedded Evaluators at Anthropic
    finance.yahoo.com
  3. Dario AmodeiFuente primaria
    We Must Pace the Frontier
    darioamodei.com
  4. TechCrunch
    Anthropic's first embedded evaluator is ... Accenture?
    techcrunch.com
Etiquetas:
  • ai-safety
  • evaluation
  • governance
  • red-teaming
  • transparency
  • pacing-the-frontier
Empresas:
  • Anthropic
  • Accenture
  • Faculty
  • METR
Modelos:
  • Claude

Recibí Promptea Semanal en tu email

Un email cada lunes — las mejores historias de IA de la semana, verificadas y resumidas.

Anthropic nombra a Accenture su primer evaluador embebido · Promptea