Imagen ilustrativa generada con IA
Anthropic prepara una marca de agua estadística para los textos generados por Claude
Anthropic introduce un sistema de marca de agua estadística para textos generados por Claude, impulsado por el AI Act europeo para aumentar la transparencia.
Texto generado por inteligencia artificial, publicado sin revisión humana. Transparencia IA
Un sistema global vinculado a las obligaciones europeas
Anthropic está preparando un sistema de marcado estadístico para identificar los textos producidos por Claude. La iniciativa, descrita el 14 de agosto de 2026, surge en el contexto de las obligaciones de transparencia del AI Act europeo y de la adhesión de la empresa a su correspondiente Code of Practice junto con otros proveedores de inteligencia artificial.
La marca de agua se aplicará inicialmente a escala global, no solo a los usuarios de la Unión Europea. Anthropic aún no dispone de un mecanismo suficientemente fiable para activarla o desactivarla según la región.
Los futuros modelos Claude generarán textos sometidos al nuevo sistema. En cambio, los modelos introducidos antes del 2 de agosto de 2026 quedan incluidos en el periodo transitorio previsto por la Unión Europea. Anthropic está trabajando para ampliar la marca de agua también a estos modelos, pero todavía no ha publicado una lista precisa de las versiones afectadas ni un calendario detallado.
Para los usuarios, el cambio debería ser invisible. El sistema no añadirá caracteres ocultos, tokens adicionales ni marcadores visibles. Según las evaluaciones internas, no debería modificar de forma apreciable la creatividad, la legibilidad, el contenido ni la calidad de las respuestas. No se prevén costes adicionales y el efecto sobre los tiempos de generación debería ser insignificante.
La firma se construye durante la generación
La tecnología elegida se basa en el enfoque SynthID-Text desarrollado por Google DeepMind. La marca de agua no se inserta después de producir la respuesta: se construye mientras Claude selecciona cada token siguiente.
Cuando existen varias continuaciones lingüísticamente plausibles, el modelo utiliza una clave secreta y parte del contexto anterior para influir en el componente aleatorio de la selección. Cada decisión sigue siendo normal y no presenta anomalías reconocibles a simple vista. Sin embargo, la secuencia completa tiende a producir una firma estadística asociada al modelo y a la clave.
Un detector que disponga de la clave puede examinar el texto y calcular hasta qué punto su comportamiento es compatible con el esperado de Claude cuando funciona con la marca de agua. No es necesariamente necesario acceder al modelo propietario ni realizar un procesamiento especialmente costoso: el análisis se centra en la distribución de las decisiones lingüísticas ya presentes en el texto.
La eficacia depende sobre todo de la cantidad y la variedad del material disponible. Un texto largo ofrece más decisiones que analizar y, por tanto, más evidencias estadísticas. El sistema también funciona mejor cuando el modelo dispone de numerosas alternativas plausibles entre las que elegir.
Por el contrario, una respuesta breve o altamente predecible contiene menos información útil. En una fórmula matemática, una definición rígida o una respuesta con una única continuación correcta, el margen para insertar una firma sin alterar el significado es muy reducido.
Las respuestas fácticas y el código tendrán menos señales
Anthropic no aplicará necesariamente la marca de agua cuando una elección alternativa pueda hacer que la respuesta sea incorrecta. Después de «2 + 2 =», por ejemplo, el token correcto es «4»: seleccionar una alternativa para reforzar la firma comprometería la fiabilidad del resultado.
La misma limitación afecta a las respuestas fácticas con una única continuación correcta, como una respuesta numérica relacionada con Nineteen Eighty-Four, de George Orwell. En situaciones similares, el modelo debe priorizar la precisión sobre la detectabilidad.
El código plantea un problema análogo. Cambiar un token puede romper la sintaxis o alterar el comportamiento del programa. Por ello, los bloques de código generalmente contendrán menos señales de marca de agua que el texto discursivo.
Aun así, el sistema podrá intervenir cuando existan decisiones arbitrarias, por ejemplo, en los comentarios del código. Anthropic considera que el impacto sobre el funcionamiento efectivo de los programas será insignificante, pero no ha indicado una cobertura uniforme para todos los lenguajes o escenarios de generación.
Las traducciones producidas por Claude también deberían conservar la marca de agua. En este caso, el modelo selecciona cada palabra de la salida en el idioma de destino, creando nuevas decisiones lingüísticas que el detector puede analizar.
La API no certificará quién escribió el texto
Anthropic está desarrollando una API capaz de estimar la probabilidad de que Claude haya contribuido a producir un contenido. El resultado no constituirá una prueba concluyente de la identidad del autor.
Un resultado positivo podrá indicar que Claude se utilizó en alguna fase del trabajo, pero no distinguirá necesariamente entre un texto generado casi por completo por el modelo y un texto humano modificado sustancialmente. Además, la marca de agua no demostrará que Claude sea el único sistema de IA involucrado.
La firma puede sobrevivir a intervenciones limitadas, como correcciones gramaticales o cambios de puntuación, porque muchas palabras originales permanecen intactas. En cambio, una reescritura completa que sustituya todo el texto debería eliminar la señal. Las muestras muy breves también reducen la fiabilidad de la evaluación.
Por tanto, el detector deberá interpretarse como una herramienta probabilística para atribuir una posible intervención de Claude. No podrá funcionar como una certificación forense del autor, del origen exclusivo del texto ni de la ausencia de intervención humana.
Anthropic todavía no ha comunicado los detalles operativos de la API. Se desconocen su disponibilidad, los métodos de autenticación, el formato de las respuestas, los umbrales de confianza o los procedimientos específicos para gestionar falsos positivos y falsos negativos.
Para imágenes y archivos gráficos llega la procedencia C2PA
Para los archivos PNG, JPG y SVG, Anthropic adoptará un mecanismo diferente. Claude añadirá metadatos de procedencia conformes con el estándar C2PA y firmados criptográficamente, que indicarán que el archivo se creó o procesó con Claude.
En este caso, el contenido binario de la imagen no se modificará para incorporar una firma estadística. La información se asociará al archivo mediante metadatos verificables, cuya validez podrá comprobarse a través de la firma digital.
La medida ofrece una distinción técnica relevante: en los textos, la procedencia se estima observando las decisiones lingüísticas; en los archivos gráficos, en cambio, se declara mediante credenciales de procedencia vinculadas al contenido.
La protección práctica de los metadatos dependerá de los flujos de intercambio y de las herramientas utilizadas para modificar o convertir los archivos. Sin embargo, el sistema anunciado todavía no indica cómo se gestionarán los metadatos C2PA cuando una imagen se vuelva a comprimir, se recorte o se exporte desde software incompatible.
Qué cambia para los usuarios y las organizaciones
Para quienes utilicen Claude, la marca de agua debería ser imperceptible y no requerir configuraciones ni acciones específicas. Las organizaciones podrán utilizar la futura API para realizar controles internos, analizar contenidos sospechosos o respaldar procesos de transparencia.
Los resultados deberán evaluarse junto con el contexto. Una puntuación positiva no demuestra que el texto haya sido escrito íntegramente por Claude, mientras que un resultado incierto puede deberse a la brevedad, la previsibilidad, el código o las modificaciones realizadas en el contenido.
La fuente no describe una vulnerabilidad ni asigna una clasificación de gravedad en materia de ciberseguridad. El impacto se refiere principalmente al cumplimiento normativo, la transparencia y la atribución probabilística de contenidos generados por inteligencia artificial.
Fuentes
Este artículo es una reelaboración original basada en las siguientes fuentes.
