Promptea.
RegulaciónImportante

OpenAI adelanta una forma de detectar abuso en la API sin leer los prompts

Private Safety Processing busca patrones de abuso entre las sesiones de un cliente y emite una señal en lugar del texto. Llega justo cuando Anthropic hace lo contrario con sus modelos frontera.

Promptea Editorial5 min de lectura

OpenAI dijo el 19 de agosto que está probando Private Safety Processing, un sistema pensado para detectar abuso repartido a lo largo del tráfico de API de un cliente sin darle al personal de OpenAI acceso a los prompts ni a las respuestas involucradas. Lo presentó junto con una reafirmación de su compromiso de Zero Data Retention para clientes elegibles de la API. El momento no es casual: los dos laboratorios frontera más grandes quedaron públicamente en veredas opuestas sobre si sus modelos más capaces se pueden vender con una garantía de cero registros.

Qué dice OpenAI que hace el sistema

La entrada en el feed de noticias de OpenAI describe dos cosas: que Zero Data Retention — ZDR — sigue disponible para clientes elegibles de la API, y que Private Safety Processing se está adelantando como vía hacia lo que la empresa llama seguridad avanzada de IA sin comprometer la privacidad de los datos. La mecánica viene de lo que reportó TechCrunch el mismo día: en vez de inspeccionar una sesión por vez, agentes automatizados buscan patrones entre interacciones relacionadas. El escenario para el que está construido es el de alguien que parte un pedido prohibido en fragmentos distribuidos entre muchas conversaciones, de modo que ningún intercambio individual active un clasificador. Cuando un patrón coincide, el sistema emite lo que TechCrunch describe como una señal acotada que identifica el tipo de actividad, y OpenAI decide sólo a partir de esa señal si corresponde intervenir. El texto de base no se expone.

Es una preview para clientes seleccionados, no disponibilidad general. La página del anuncio de OpenAI rechaza a los clientes automatizados, así que todo lo que está por debajo del resumen del feed — elegibilidad, qué modelos cubre, cómo se define y se acota la señal, cuándo sale — es reporte periodístico y no documentación. Conviene leerlo con esa etiqueta puesta.

Qué cubre ZDR hoy

La documentación de controles de datos de OpenAI es bastante más precisa que el lenguaje del anuncio, y vale la pena leerla antes de suponer qué está haciendo ahí la palabra 'cero'. Por defecto, cada request a la API genera registros de monitoreo de abuso que pueden contener prompts, respuestas y salidas de clasificadores, guardados hasta 30 días. Los clientes aprobados pueden pasar a Modified Abuse Monitoring, que excluye el contenido del cliente de esos registros, o a Zero Data Retention, que hace lo mismo y además fuerza el parámetro `store` de `/v1/responses` y `/v1/chat/completions` a `false`, sin importar lo que pida el request. Los dos requieren aprobación previa de OpenAI y aceptar términos contractuales adicionales, y en los dos casos el cliente queda a cargo de controlar a sus propios usuarios.

Esa misma página detalla dos excepciones que importan acá. Bajo Eyes Off, OpenAI se reserva el derecho de dejar modelos puntuales fuera de ZDR o de Modified Abuse Monitoring para un cliente puntual, avisando por escrito con anticipación; el contenido entonces se guarda, pero queda excluido de la revisión humana salvo que la ley exija lo contrario. Bajo Safety Retention, la misma excepción aplica cuando resulta, en palabras de la documentación, razonablemente necesario para investigar o prevenir actividad de riesgo severo — y ahí sí OpenAI puede guardar y hacer revisar por personas el contenido que sus clasificadores marquen como posible violación de las políticas de uso. Private Safety Processing se entiende mejor como un intento de reducir cuántas veces hay que invocar esas excepciones, no como un reemplazo.

Por qué Anthropic fue para el otro lado

La documentación de API y retención de datos de Anthropic toma la posición contraria para sus modelos más fuertes, y lo dice sin rodeos. Claude Fable 5 y Claude Mythos 5 están designados Covered Models, exigen retención de datos de 30 días y no están disponibles bajo ZDR. La aplicación es mecánica antes que contractual: un pedido a Fable 5 desde una organización cuya configuración de retención no cumple el requisito devuelve un `400 invalid_request_error`. Una organización con un acuerdo de ZDR vigente puede habilitar retención de 30 días en un workspace puntual para usar esos modelos ahí, mientras el resto de sus workspaces sigue en cero.

El resultado práctico es que un comprador con un requisito duro de no retención puede usar Claude, pero no el nivel frontera de Anthropic. TechCrunch presenta el anuncio de OpenAI como un intento de superar esa posición; esa es la lectura de TechCrunch sobre el timing competitivo, no algo que haya dicho OpenAI. La respuesta de Anthropic en esa misma nota es que su revisión humana pasa por una vía de acceso controlada, con registros a prueba de manipulación de cada sesión de revisión — un argumento sobre la integridad de la retención más que sobre cómo evitarla.

Qué cambia para quien construye sobre estas APIs

  • Si comprás bajo un requisito de cero registros, elección de modelo y política de datos son una sola decisión, no dos. Del lado de Anthropic eso ya está aplicado en código: la API devuelve 400 en vez de degradarse en silencio. Revisá la configuración de retención del workspace, no sólo la de la organización.
  • La detección de patrones entre sesiones cambia cómo se ve desde afuera una carga de trabajo legítima. Un agente que descompone una tarea en muchas llamadas chicas e independientes tiene, estructuralmente, la misma forma que la evasión que esto busca atrapar. Ningún laboratorio publicó cómo distingue una cosa de la otra.
  • 'Retención cero' nunca significó 'sin monitoreo' en la plataforma de OpenAI, y la documentación lo dice con todas las letras. Si tu argumento de cumplimiento se apoya en esa frase, leé las cláusulas de Eyes Off y Safety Retention en vez de la página de marketing.
  • Nada de esto está disponible todavía para construir encima. No hay feature lanzada, ni flag de configuración, ni especificación publicada de la señal.

La afirmación que sostiene todo esto — que se puede detectar abuso coordinado entre sesiones sin aprender nada sobre el contenido de ninguna — es fuerte, y es exactamente el tipo de afirmación que necesita una descripción técnica y revisión externa antes de significar algo. OpenAI no publicó ninguna de las dos. Hasta que lo haga, el resumen honesto es que OpenAI declaró una intención que sería importante si se sostiene, y que Anthropic, por ahora, decidió que ese mismo problema no se resuelve así para sus modelos frontera.

Por qué importa

  • La política de retención de datos se volvió, sin que nadie lo anunciara, una restricción de selección de modelo. Si tu organización contrató retención cero, la documentación de Anthropic dice que sus dos modelos más capaces quedan fuera hasta que actives retención de 30 días en un workspace. Compras y elección de modelo pasaron a ser la misma decisión.
  • La detección entre sesiones es una forma de monitoreo distinta de los clasificadores por request que usa la mayoría de los sistemas de seguridad de API. Asume un adversario que reparte una tarea prohibida entre muchas sesiones, que es exactamente lo que parece un loop de agentes visto desde afuera.
  • Si un canal que sólo transmite señales funciona de verdad, debilita el argumento estándar de la industria de que el monitoreo serio exige guardar el contenido. Sobre ese argumento se apoyan casi todas las excepciones de retención.

Puntos clave

  • OpenAI anunció el 19 de agosto que está probando Private Safety Processing con clientes seleccionados, junto con una reafirmación de Zero Data Retention para clientes elegibles de la API.
  • Según lo que reportó TechCrunch, agentes automatizados buscan abuso entre interacciones relacionadas y emiten una señal acotada que nombra el tipo de actividad, sin exponer los prompts ni las respuestas.
  • La documentación de controles de datos que ya tenía OpenAI contempla Eyes Off y Safety Retention: cláusulas que permiten dejar modelos puntuales fuera de ZDR para un cliente puntual, avisando por escrito con anticipación.
  • La documentación de Anthropic designa a Claude Fable 5 y Claude Mythos 5 como Covered Models con retención obligatoria de 30 días; ZDR no está disponible para ellos y los pedidos que no cumplen devuelven un 400 invalid_request_error.
  • No salió nada todavía. No hay paper técnico, ni evaluación independiente, ni detalle publicado sobre cómo se construye o se acota esa señal.

Fuentes

  1. OpenAIFuente primaria
    Offering Zero Data Retention for frontier models (OpenAI News feed entry)
    openai.com
  2. OpenAIFuente primaria
    Data controls in the OpenAI platform
    developers.openai.com
  3. AnthropicFuente primaria
    API and data retention
    platform.claude.com
  4. TechCrunch
    OpenAI seeks to one-up Anthropic with new customer privacy protections
    techcrunch.com
Etiquetas:
  • zero-data-retention
  • api
  • privacy
  • enterprise
  • ai-safety
  • data-governance
  • abuse-monitoring
Empresas:
  • OpenAI
  • Anthropic
Modelos:
  • Claude Fable 5
  • Claude Mythos 5