Promptea.
ProductoImportante

Anthropic afloja las salvaguardas de biología de Fable 5 y dice que el sobrebloqueo cayó 85%

La empresa reescribió las reglas que sigue su clasificador de seguridad. Las consultas cotidianas de salud y biología deberían obtener respuesta, pero el número del titular es de Anthropic y nadie lo verificó de forma independiente.

Promptea Editorial3 min de lectura

Anthropic anunció el 7 de agosto de 2026 que cambió la forma en que Claude Fable 5 maneja biología. Reescribió el conjunto de reglas — lo llama constitución — que su clasificador de seguridad usa para decidir qué cuenta como pedido restringido, generó datos de entrenamiento nuevos a partir de esas reglas y reentrenó el clasificador.

El objetivo concreto era el sobrebloqueo. Fable 5 venía rechazando, o derivando, consultas claramente inofensivas: leer resultados de laboratorio, entender síntomas, hacer la tarea de biología.

Qué dicen realmente los números

Anthropic reporta que los fallbacks relacionados con biología bajaron cerca de 85% en pruebas. Un fallback acá no significa un rechazo liso y llano: significa que el pedido se deriva a Opus 5 en lugar de que lo responda Fable 5.

La empresa también da una reducción esperada del volumen total de fallbacks, y la diferencia entre superficies es lo más informativo del anuncio:

  • Claude.ai — alrededor de 67% menos fallbacks totales
  • Cowork — 55%
  • Claude Code — 17%
  • Claude Platform (la API) — 7%

Esa pendiente merece una lectura atenta. Implica que el sobrebloqueo de biología era, sobre todo, un problema del chat de consumo: dos tercios de todo lo que se derivaba en Claude.ai era del área de biología, contra aproximadamente uno de cada catorce en la API. Si construís sobre Platform, este cambio es casi un error de redondeo. Si usás Claude.ai para algo que roce la salud, no lo es.

Qué se sigue derivando

Anthropic es explícita en que esto es un reajuste, no una eliminación. Fable 5 sigue derivando a Opus 5 los pedidos que la empresa considera de uso dual, y nombra virología, toxicología y diseño molecular. También describe al modelo como todavía inadecuado para investigación biológica profesional y desarrollo de fármacos.

La empresa dice que está trabajando en vías de acceso confiable: un camino con verificación previa para investigadores que necesitan capacidad de frontera en biología sin exposición abierta. No dio plazos ni criterios de elegibilidad.

Qué no está establecido

El 85%, y los números por superficie, salen de las pruebas internas de Anthropic. Leímos dos coberturas independientes publicadas el mismo día y ninguna reproduce la medición ni describe la metodología: las dos atribuyen la cifra a Anthropic. No existe un benchmark público de falsos positivos en salvaguardas de biología, así que hoy no hay forma de que un tercero lo verifique.

Anthropic tampoco publica qué le hace el cambio a los falsos negativos, es decir, los pedidos que deberían haberse derivado y ahora no. Un clasificador ajustado para bloquear menos, en igualdad de condiciones, también detecta menos. El anuncio no cuantifica ese lado del intercambio.

Por qué importa si escribís prompts

Se desprenden dos cosas. Primero: si habías armado rodeos para esquivar el sobrebloqueo de biología — eufemismos, frases indirectas, partir una pregunta en pedazos — esos rodeos ahora resuelven un problema que quizá ya no existe, y la indirección suele dar peores respuestas que preguntar derecho. Probá la versión directa antes de conservar el truco.

Segundo: un fallback es un cambio de modelo, no un error. Cuando Fable 5 deriva a Opus 5, obtenés el comportamiento, la latencia y el costo de otro modelo sin una señal explícita en la salida. Si venías atribuyendo resultados inconsistentes en prompts de salud al azar, el ruteo silencioso es una explicación más probable, y este cambio mueve dónde está esa frontera.

Por qué importa

  • El sobrebloqueo en consultas cotidianas de salud y biología era una de las fallas más reportadas del chat de IA de consumo; esto es un intento directo de arreglarlo.
  • La diferencia entre superficies muestra que el problema estaba concentrado en el chat de consumo y no en la API, así que el impacto para quien desarrolla es mucho menor de lo que sugiere el titular.
  • El ajuste de clasificadores de seguridad suele ser invisible. Publicar los números, aun sin verificar, vuelve discutible un intercambio que antes era silencioso.

Puntos clave

  • Anthropic dice que los fallbacks de biología en Fable 5 bajaron cerca de 85% tras reentrenar su clasificador de seguridad.
  • La reducción total esperada es despareja: ~67% en Claude.ai contra 7% en la API.
  • Virología, toxicología y diseño molecular siguen derivándose a Opus 5; el modelo sigue sin ser apto para investigación biológica profesional.
  • Todas las cifras son de Anthropic: no hay evaluación independiente y no se publicó el efecto sobre los falsos negativos.
Etiquetas:
  • safety
  • safeguards
  • model-routing
  • biology
Empresas:
  • Anthropic
Modelos:
  • Fable 5
  • Opus 5
Anthropic afloja las salvaguardas de biología de Fable 5 · Promptea