Anthropic explica cómo funciona la marca de agua en el texto de Claude, y dónde casi no deja rastro
El mecanismo es la elección de palabras guiada por una clave. Lo interesante es la lista que hace la propia Anthropic de los casos donde la marca casi no aparece, código incluido.
Anthropic publicó el 14 de agosto una explicación técnica de cómo funciona realmente la marca de agua invisible que aplica al texto que genera Claude. El compromiso en sí no era nuevo: a principios de mes la empresa había dicho que iba a empezar a marcar el texto generado por Claude, y las reglas europeas de transparencia que impulsan el cambio entraron en aplicación el 2 de agosto. Lo que llegó hoy es el mecanismo, junto con algo más útil que el mecanismo: el propio relato de Anthropic sobre los casos en los que la marca casi no deja rastro.
Cambiar de dónde viene el azar
Marcar texto es más difícil que marcar una imagen. Una imagen tiene detalle redundante que se puede alterar sin que nadie lo note. Un párrafo no: si cambiás las palabras, cambiaste el contenido. El enfoque de Anthropic no agrega nada al texto. Cambia la fuente del azar que el modelo usa mientras escribe.
En cada paso, un modelo de lenguaje reduce la próxima palabra a un conjunto de candidatas que considera plausibles y después elige una. Ese sorteo normalmente se apoya en un generador de números aleatorios común. Anthropic lo reemplaza por una función de una clave criptográfica secreta y las pocas palabras inmediatamente anteriores. La elección sigue repartida entre candidatas que el modelo ya había juzgado aceptables, así que la prosa se lee igual, pero ahora es reproducible por cualquiera que tenga la clave. En palabras de Anthropic, las palabras que elige Claude siguen siendo aleatorias, pero se puede revisar la secuencia y ver si es consistente con las elecciones que Claude haría usando la clave.
La detección es entonces estadística y acumulativa. Una sola palabra no prueba nada. Lo que sirve de señal es una tirada suficientemente larga de palabras cuyas elecciones coinciden con lo que habría producido la clave. Ese planteo deja servida la limitación que más importa: la marca es tan fuerte como la cantidad de elección real que tuvo el modelo al escribir.
Dónde dice Anthropic que la marca es débil
La empresa es poco habitualmente directa en este punto. Su propia lista de casos débiles:
- Pasajes cortos. Muy pocas elecciones de palabras para que la señal se acumule.
- Escritura factual. Cuando un término específico es el único correcto, no queda margen para codificar nada y la marca sale rala.
- Código, por la misma razón, y corrección de textos, donde Claude deja la mayoría de las palabras del autor y las palabras marcadas son una minoría.
- Edición posterior fuerte. Retoques livianos probablemente no borren la marca; una reescritura que reemplace todas las palabras sí.
- La atribución misma. Un resultado positivo significa que Claude probablemente participó en la producción del texto. No distingue entre 'Claude escribió esto' y 'Claude editó esto', no permite establecer que una persona no lo escribió y no dice nada sobre si intervino otro sistema de IA.
Qué implica si construís sobre Claude
Para quien usa Claude como asistente de programación, la respuesta práctica es que cambia muy poco. La propia Anthropic dice que el código lleva una marca mínima, porque el conjunto de tokens aceptables dentro del cuerpo de una función es angosto. Lo mismo vale para las pasadas de edición y limpieza que mucha gente le hace a su propia escritura. La señal más fuerte cae sobre prosa larga y discursiva generada desde cero, que es donde se concentra la ansiedad por la detección, así que el diseño es coherente. También significa que la marca es más delgada en casi todo el uso cotidiano de desarrollo.
Hay dos cosas que todavía no están disponibles. Anthropic dice que va a ofrecer una API de detección de la marca y que todavía está definiendo los detalles de su implementación, así que por ahora nadie fuera de la empresa puede verificar un pasaje. Y no se publicaron cifras de precisión: no hay tasa declarada de falsos positivos, ni de falsos negativos, ni una extensión mínima de texto a partir de la cual el detector sea confiable. Hasta que eso exista, tomar un resultado de marca de agua como prueba en una disputa académica o laboral sería prematuro, y el propio encuadre de Anthropic, que habla de probabilidad y no de prueba, juega en contra.
Los archivos se tratan distinto. Las imágenes y otros tipos de archivo compatibles reciben una credencial de contenido C2PA: una nota firmada criptográficamente en los metadatos del archivo, en lugar de algo escondido dentro del contenido. Anthropic también afirma que ni la marca ni su clave llevan información que permita identificar a una persona usuaria, una organización o una conversación.
El reloj regulatorio detrás
El motor es regulatorio. La Comisión Europea empezó a aplicar el Reglamento de IA el 2 de agosto de 2026 y, en la misma fecha, entraron en vigencia las obligaciones de transparencia: los sistemas interactivos tienen que avisar que son IA, los deepfakes tienen que estar etiquetados y el contenido generado o alterado por IA tiene que llevar marcas legibles por máquina para que se pueda detectar. El comunicado del 31 de julio de la Comisión ubicó a más de 180 organizaciones en su primera lista de firmantes del Código de Buenas Prácticas sobre transparencia del contenido generado por IA, que operativiza esas reglas. Anthropic, que dice haber firmado en julio, habla de alrededor de 190.
La cobertura sigue las fechas de lanzamiento. Los modelos publicados desde el 2 de agosto se marcan desde el lanzamiento, mientras que los Claude anteriores quedan dentro de un período de transición y se van a cubrir en los próximos meses. La cobertura periodística del anuncio inicial indicó que el marcado abarca la API, Claude, Claude Code, Claude Cowork y Claude Tag.
El resumen honesto es que esto es una señal de procedencia construida para cumplir con un requisito legal puntual, descrita con franqueza por la empresa que la implementa y todavía no verificable por nadie más. Es mejor que un proveedor afirmando una precisión de detección que nadie puede auditar. Igual significa que la única evidencia disponible hoy sobre qué tan bien funciona todo esto es la de la propia Anthropic.
Por qué importa
- El texto que genera Claude ahora lleva una señal de procedencia por defecto, pero Anthropic dice que es más débil justo en código y en ediciones livianas, dos de los usos más frecuentes entre desarrolladores.
- La API de detección todavía no salió, así que hoy nadie fuera de la empresa puede verificar un pasaje, y Anthropic no publicó tasas de falsos positivos ni de falsos negativos.
- La marca no distingue entre un texto que Claude escribió y uno que Claude editó, lo que debilita cualquier intento de usarla como prueba en el ámbito académico o laboral.
Puntos clave
- Anthropic publicó el mecanismo el 14 de agosto: el muestreo entre las palabras plausibles se guía con una clave criptográfica más las palabras previas, en lugar de un generador de números aleatorios común.
- La detección es estadística y se acumula con la extensión. Un texto corto, factual o con mucho código deja poca señal, y una pasada de corrección casi ninguna.
- Los modelos lanzados desde el 2 de agosto de 2026 se marcan desde el lanzamiento; los Claude anteriores quedan cubiertos en los próximos meses. Las imágenes y otros archivos compatibles reciben credenciales C2PA en su lugar.
- El disparador es el régimen de transparencia del Reglamento de IA de la UE, en aplicación desde el 2 de agosto de 2026, y el Código de Buenas Prácticas que según la Comisión firmaron más de 180 organizaciones.
Fuentes
- AnthropicFuente primariaHow Claude's text watermark worksanthropic.com
- TechCrunchAnthropic says it will watermark text generated by its AI modelstechcrunch.com
- European CommissionFuente primariaCommission starts enforcing AI Act rules and new transparency requirements on 2 Augustdigital-strategy.ec.europa.eu
- watermarking
- provenance
- eu-ai-act
- transparency
- ai-detection
- coding-agents
- Anthropic
- European Commission
- Claude