Anthropic explica cómo marcará los textos de Claude: la señal estará en la elección de palabras

Anthropic explica cómo marcará los textos de Claude: la señal estará en la elección de palabras

La empresa usará una variante de SynthID-Text que no añade caracteres ocultos ni metadatos. La marca se introduce durante el muestreo de tokens, alterando de forma imperceptible la fuente de aleatoriedad con la que Claude elige entre continuaciones plausibles, y sólo permite estimar probabilísticamente si el modelo intervino en un texto.

Anthropic explicó cómo incorporará marcas de agua invisibles a los textos generados por futuros modelos de Claude, en un intento por despejar una de las principales dudas alrededor de las nuevas obligaciones europeas para identificar contenido generado por inteligencia artificial. La empresa confirmó que no añadirá caracteres ocultos, cadenas especiales, metadatos dentro del texto ni tokens adicionales: la señal se insertará en el propio proceso mediante el cual el modelo selecciona qué token generar a continuación.

La técnica será una versión de SynthID-Text, el método desarrollado por Google DeepMind y publicado en 2024. En términos simples, un modelo de lenguaje no escribe una oración de una sola vez. En cada paso calcula una distribución de probabilidades para los posibles tokens siguientes y elige entre ellos. En muchos contextos existe una única continuación claramente preferible, pero en otros hay varias alternativas lingüísticas prácticamente equivalentes. Es precisamente en esas decisiones de bajo impacto donde puede introducirse una marca estadística.

La marca está en el patrón de elecciones

Anthropic describe el mecanismo como un cambio en la fuente de aleatoriedad utilizada durante el muestreo. Cuando Claude tiene varias continuaciones razonables, la selección no depende únicamente de un generador de números aleatorios convencional. Una clave secreta, combinada con parte del contexto precedente, ayuda a determinar qué opción se elige entre candidatos que el modelo ya consideraba plausibles.

El resultado no es una palabra extra ni un símbolo escondido. Es un patrón distribuido a través de muchas decisiones de generación. Una persona que lea el documento no debería poder distinguir un texto marcado de uno no marcado. Sin embargo, un detector que conozca la clave puede analizar la secuencia de tokens y comprobar si las elecciones observadas coinciden con el patrón estadístico que habría producido el mecanismo de marcado.

Eso significa que la detección no funciona como una firma criptográfica binaria que responda simplemente “sí” o “no”. El sistema estima una probabilidad de que Claude haya participado en la producción del contenido. Anthropic subraya que la señal sólo responde a esa pregunta: no demuestra que todo el texto haya sido escrito por Claude, no identifica a la persona que lo solicitó y tampoco permite saber si otro modelo de IA participó en el documento.

La explicación es relevante porque buena parte de la discusión pública alrededor de las marcas de agua para texto ha asumido mecanismos similares a los utilizados en imágenes o archivos: caracteres invisibles, metadatos, espacios especiales o algún identificador incrustado que pudiera eliminarse al copiar y pegar. En el sistema descrito por Anthropic no hay nada de eso. La marca vive en la distribución de elecciones lingüísticas que realiza el modelo.

No todas las respuestas pueden marcarse igual

La técnica depende de que existan suficientes decisiones en las que varias opciones sean válidas. Por esa razón funciona mejor en textos largos y abiertos, como ensayos, explicaciones o redacciones creativas. Cuanto mayor sea la muestra, más información estadística acumula el detector y mayor puede ser su confianza.

En cambio, la marca será más débil en respuestas cortas, contenido factual, operaciones matemáticas y fragmentos de código donde cambiar una palabra o token podría alterar la exactitud. Anthropic utiliza como ejemplo una expresión matemática: después de “2 + 2 =” prácticamente no existe libertad para elegir otra respuesta correcta. Algo similar ocurre con nombres propios, datos específicos o instrucciones de programación cuya sintaxis debe ser exacta.

El mismo límite aparece cuando Claude sólo corrige ortografía, gramática o puntuación de un texto humano. Si el modelo modifica unas cuantas palabras, hay pocas decisiones propias sobre las cuales dejar el patrón. Las traducciones, en cambio, sí podrán contener una señal más amplia porque el modelo selecciona prácticamente todos los términos del texto de salida.

La marca tampoco es imposible de eliminar. Anthropic reconoce que pequeñas modificaciones probablemente conservarán parte de la señal, pero una reescritura profunda puede reducirla hasta volverla indetectable. Ésta es una limitación conocida de los sistemas de watermarking estadístico: cuanto más cambia la secuencia original, menos evidencia queda de las decisiones realizadas durante la primera generación.

No lleva identidad del usuario

Anthropic asegura que la marca no contiene información sobre la cuenta, la organización, el chat o la persona que utilizó Claude. La clave sirve para reconocer el patrón de generación del modelo, no para codificar un identificador individual. Por ello, incluso una detección positiva no permitiría reconstruir quién solicitó el texto ni desde qué conversación se produjo.

La compañía también distingue este mecanismo de las herramientas comerciales que intentan detectar textos de IA analizando estilo, vocabulario o regularidades lingüísticas. Esos clasificadores buscan señales aprendidas en el contenido terminado. La marca de agua de Claude, por el contrario, se introduce deliberadamente mientras el modelo genera el texto y posteriormente se busca mediante una clave asociada al mecanismo de marcado.

Anthropic anunció que ofrecerá próximamente una API de detección, aunque todavía no ha publicado los detalles de su implementación. La empresa sí reveló que su sistema deriva de SynthID-Text, pero la clave específica y otros parámetros necesarios para verificar la señal deberán mantenerse controlados para que la detección tenga utilidad.

La regulación europea se aplicará inicialmente a Claude en todo el mundo

El cambio responde a las obligaciones de transparencia del artículo 50 de la Ley de Inteligencia Artificial de la Unión Europea. La norma exige a los proveedores de sistemas capaces de generar audio, imágenes, video o texto sintético que los resultados puedan ser marcados en un formato legible por máquinas y detectados como contenido generado o manipulado mediante IA, dentro de los límites técnicamente viables.

Anthropic también firmó el Código de buenas prácticas sobre transparencia de contenidos generados por IA, mecanismo promovido por la Comisión Europea para facilitar el cumplimiento de esas obligaciones. Las reglas correspondientes comenzaron a aplicarse el 2 de agosto de 2026.

Aunque el origen de la obligación es europeo, Anthropic aplicará inicialmente el watermarking de forma global. La compañía sostiene que todavía no tiene una manera duradera de restringir la marca únicamente a las generaciones realizadas para usuarios de la Unión Europea. En consecuencia, los futuros modelos de Claude podrán producir texto marcado también en otros países.

Los modelos lanzados antes del 2 de agosto cuentan con un periodo de transición y Anthropic señaló que irá incorporando el sistema durante los próximos meses. Para archivos como PNG, JPG o SVG utilizará una técnica diferente: credenciales C2PA firmadas criptográficamente en los metadatos. Esas credenciales no deben confundirse con el watermark estadístico aplicado al texto.

La propuesta, por tanto, no crea un sello infalible de “texto escrito por IA”. Su función es más limitada: dejar una señal probabilística suficientemente consistente para que, cuando exista una muestra adecuada y se disponga de la clave correspondiente, pueda evaluarse si Claude intervino en la generación. La eficacia real dependerá de la longitud y naturaleza del contenido, de cuánto haya sido editado posteriormente y de cómo se implemente el detector que Anthropic todavía prepara.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *