Los planes de watermarking de Anthropic y Google convierten palabras corrientes en una etiqueta de IA
- Sophie Larsen

- hace 4 días
- 14 min de lectura
Anthropic ha incorporado el watermarking invisible de texto a los nuevos modelos Claude, pese a reconocer que una edición corriente puede debilitar o borrar la señal. La comparación entre Anthropic y Google importa ahora porque ambas empresas utilizan elecciones estadísticas de palabras para responder a la creciente demanda de procedencia de IA legible por máquinas.
Anthropic afirma que su sistema marca el texto mediante decisiones de redacción intrascendentes. SynthID Text de Google ajusta de forma similar las probabilidades de los tokens mientras un modelo genera una respuesta. Ninguno de los dos enfoques inserta una etiqueta visible, un carácter Unicode oculto ni un sello permanente de propiedad.
Esta distinción crea el conflicto central. Los reguladores quieren que el contenido generado siga siendo identificable, pero el lenguaje es especialmente fácil de reescribir, traducir, acortar o combinar con trabajo humano. Un watermark puede ayudar en las comprobaciones de procedencia sin demostrar quién redactó realmente un documento.
El momento es regulatorio. El artículo 50 de la Ley de IA de la Unión Europea pasó a ser aplicable el 2 de agosto de 2026. Sus disposiciones de transparencia exigen a los proveedores que hagan detectables los resultados generados en un formato legible por máquinas, cuando sea técnicamente viable.
Para empresas, desarrolladores, editores y estudiantes, la cuestión va más allá de Claude o Gemini. El marcado estadístico puede acompañar al texto al copiarlo y pegarlo. Sin embargo, también puede marcar documentos en los que un sistema de IA solo tradujo, dio formato o pulió una redacción humana.
Los nuevos modelos de Anthropic marcarán texto en todo el mundo
Anthropic está tratando el watermarking como un requisito a nivel de modelo, no como una función regional limitada a usuarios europeos.
La guía de marcado de la empresa indica que los nuevos modelos marcarán el contenido generado desde su primer lanzamiento. Anthropic aplica este enfoque allí donde se ofrecen esos modelos, incluidos mercados fuera de la Unión Europea.
Ese alcance implica que la marca puede aparecer en los productos y canales de distribución de Claude. No se limita al texto copiado del sitio web de Claude. Los resultados entregados mediante una API o un socio de nube pueden llevar la misma señal estadística.
La política cubre los modelos lanzados después de que las obligaciones de la UE pasaran a ser aplicables el 2 de agosto de 2026. Anthropic también planea adaptar modelos antiguos elegibles durante un período de transición que termina el 2 de diciembre.
El watermarking de texto de Anthropic funciona de forma distinta a los metadatos de archivos. La señal se entreteje en el lenguaje generado mediante elecciones que la empresa describe como intrascendentes. Son casos en los que varias palabras pueden comunicar prácticamente la misma idea sin alterar materialmente la respuesta.
Los archivos generados reciben otra capa de procedencia. Anthropic afirma que las imágenes compatibles, incluidos los archivos SVG, PNG y JPG, pueden llevar metadatos firmados basados en el estándar de procedencia de contenido C2PA.
Las credenciales C2PA registran información sobre cómo se creó o editó un archivo compatible. Esa información se desplaza en un manifiesto firmado, en lugar de hacerlo mediante el patrón estadístico utilizado para el texto sin formato.
El uso de métodos separados refleja las propiedades de cada medio. Una imagen contiene muchos píxeles ajustables y también puede incorporar metadatos estructurados. El texto sin formato ofrece menos lugares donde ocultar información sin cambiar el significado.
El anuncio de Anthropic sigue al código de transparencia de la UE, un marco voluntario de cumplimiento desarrollado mediante un proceso multilateral. El código separa las obligaciones de los proveedores de marcar contenido de las obligaciones de los implementadores de aplicar un etiquetado visible.
Esta separación es importante. Un watermark legible por máquinas ayuda al software a inspeccionar un resultado, pero no informa automáticamente a un lector de que intervino la IA. Los editores y otros implementadores pueden seguir enfrentando obligaciones de divulgación independientes.
El artículo 50 tampoco establece una regla universal según la cual toda frase asistida por IA deba recibir una advertencia pública. La ley contiene excepciones y distinciones relacionadas con la revisión editorial, el contenido de interés público, la obra artística y la responsabilidad de publicación.
La implementación de Anthropic va más allá del alcance geográfico mínimo. Un modelo globalmente coherente evita mantener comportamientos de generación distintos para solicitudes europeas y no europeas. También ofrece a los desarrolladores posteriores una única política de procedencia que documentar.
Esa coherencia tiene un coste. Un desarrollador que atiende a usuarios en Canadá o Estados Unidos puede recibir resultados marcados porque el modelo subyacente sigue una política mundial. La ubicación del usuario no elimina necesariamente la señal.
Por tanto, el acontecimiento cambia más que la documentación de cumplimiento de Claude. Introduce la procedencia en la ruta normal de generación de los futuros modelos y convierte una regla de transparencia de la UE en un comportamiento global de producto.
Cómo el watermarking de texto de Anthropic y Google utiliza la elección de palabras
El watermark es una tendencia estadística repartida entre muchas decisiones, no un mensaje secreto oculto dentro de una sola palabra.
Un modelo de lenguaje produce texto token a token. Un token es una palabra, un signo de puntuación o un fragmento de palabra que el modelo procesa como unidad de generación.
En cada paso, el modelo asigna probabilidades a posibles tokens siguientes. Varios candidatos pueden ser aceptables cuando la frase no exige una respuesta exacta. Un sistema de watermarking puede favorecer candidatos seleccionados según un patrón secreto.
Pensemos en una frase rutinaria sobre una reunión. El modelo podría elegir entre “sin embargo”, “aun así” o “no obstante” sin alterar la información esencial. Muchas decisiones pequeñas pueden crear una firma estadística detectable a lo largo de una respuesta más extensa.
Anthropic describe su marcado en términos de palabras intrascendentes. Esa formulación sugiere que el sistema apunta a elecciones en las que una sustitución no debería alterar el significado, la precisión factual ni los detalles útiles.
La empresa no ha divulgado públicamente todos los parámetros de implementación. Por ello, los lectores deben evitar asumir que su detector, estructura de claves secretas o umbrales de puntuación coinciden con el diseño de Google.
Google ha explicado su propio enfoque con mayor detalle. Google SynthID text modifica las probabilidades de los tokens durante la generación y evalúa el patrón resultante durante la detección.
Google afirma que su método funciona mejor con respuestas más largas y variadas. Los ensayos, guiones y borradores alternativos de correos electrónicos ofrecen a un modelo muchas oportunidades de elegir entre tokens plausibles.
Las indicaciones factuales presentan un caso más difícil. Una pregunta con una respuesta breve y exacta ofrece al modelo poca libertad. Alterar una palabra clave podría reducir la precisión de la respuesta, por lo que un watermark seguro tiene menos opciones utilizables.
La misma restricción se aplica al código fuente, las fórmulas, las citas, las cláusulas legales y el lenguaje estandarizado. Una sustitución supuestamente intrascendente puede volverse significativa cuando importa la sintaxis o la redacción precisa.
Google evaluó SynthID Text en cerca de 20 millones de respuestas de Gemini para una investigación publicada en Nature. Los investigadores compararon generaciones con y sin watermarking, incluidos los comentarios de los usuarios sobre la calidad de las respuestas.
La investigación sobre watermarking resultante describió un diseño no distorsionador. En ese marco, el sistema evita asignar probabilidades a tokens que el modelo sin watermarking no habría podido seleccionar.
Esta propiedad ayuda a preservar la calidad, pero no hace que la señal sea indestructible. Google afirma que el recorte, algunas ediciones y una paráfrasis leve pueden conservar cierta detectabilidad. Una reescritura profunda o una traducción pueden reducir drásticamente la confianza.
Anthropic ofrece advertencias similares. Puede que un texto corto no contenga suficientes elecciones para que un detector alcance confianza. Combinar pasajes marcados y no marcados puede diluir el patrón.
La edición intensiva plantea un problema más fundamental. Un watermark estadístico depende de la secuencia seleccionada. Sustituir suficientes palabras genera una secuencia distinta, incluso cuando el documento revisado conserva el significado original.
Copiar texto en un procesador de textos no elimina por sí mismo la señal. La marca está representada por las palabras, por lo que el copiado y pegado normal conserva la secuencia relevante.
Los cambios de formato son más complejos. Mover párrafos puede preservar muchos patrones locales, mientras que un resumen agresivo puede descartarlos. Una traducción regenera casi todos los tokens y puede eliminar la firma original.
Este mecanismo explica por qué invisible no significa permanente. También explica por qué un detector devuelve evidencia con un nivel de confianza, en lugar de descubrir un número de serie indiscutible.
Por tanto, la distinción práctica entre Anthropic y Google es menor de lo que sugieren los titulares. Ambos enfoques dependen de regularidades estadísticas en el lenguaje generado. Ambos se enfrentan al mismo conflicto entre detectabilidad, calidad y resistencia a la edición.
La comparación entre Anthropic y Google trata en realidad sobre cumplimiento
Anthropic y Google convergen en el watermarking porque la regulación ahora recompensa una procedencia implementable, incluso cuando la tecnología sigue siendo incompleta.
Google presentó SynthID para imágenes en 2023 y después lo amplió a texto y vídeo en 2024. Más tarde, la empresa publicó como código abierto el componente de texto para que otros desarrolladores de modelos pudieran incorporar watermarking a las canalizaciones de generación.
En julio de 2026, Google firmó el Código de buenas prácticas de la UE sobre transparencia del contenido generado por IA. Su compromiso con el código destacó SynthID, C2PA y asociaciones que respaldan un watermarking interoperable.
Anthropic había adoptado anteriormente una postura pública más cautelosa. En una presentación de 2023 al gobierno de Estados Unidos, calificó el watermarking de prometedor, pero fácil de derrotar para actores maliciosos.
La empresa también advirtió que un texto dañino o engañoso podría recibir una marca válida. Un watermark puede identificar la participación de un modelo sin establecer que la afirmación resultante sea precisa o segura.
Esa evaluación anterior no ha dejado de ser relevante. La política de Anthropic de 2026 incluye limitaciones explícitas, lo que demuestra que el despliegue no equivale a confiar en el watermarking como sistema independiente de rendición de cuentas.
Lo que cambió fue el entorno de cumplimiento. La Comisión Europea afirma que las obligaciones del artículo 50 abordan el engaño y la manipulación mediante requisitos de marcado, detección y etiquetado.
La Comisión ha respaldado el código de transparencia como una vía voluntaria adecuada para demostrar el cumplimiento. Los signatarios obtienen un marco común de implementación en todos los Estados miembros de la Unión Europea.
Los proveedores que elijan una vía distinta aún pueden cumplir. Sin embargo, deben demostrar que sus medidas alternativas satisfacen la ley. Esa evaluación individual puede introducir más incertidumbre y trabajo administrativo.
Esto hace que un watermark técnicamente imperfecto sea comercialmente racional. Una señal estandarizada y documentada puede respaldar flujos de trabajo de cumplimiento, integraciones de plataformas y registros de auditoría, incluso cuando no puede sobrevivir a todos los ataques.
El principal adversario no es Anthropic frente a Google como proveedores rivales. Es la demanda regulatoria de identificación persistente frente a la naturaleza editable del lenguaje.
Ambas empresas pueden mejorar los detectores, las claves y los métodos de generación. Ninguna puede impedir que un usuario exprese la misma idea con palabras completamente diferentes.
OpenAI también ha respaldado el código europeo de transparencia y ha expresado la ambición de ampliar las señales de procedencia a todas las modalidades. Esta amplia alineación aumenta la presión para establecer una base de referencia en el sector.
Si los grandes proveedores marcan el texto de formas distintas, las plataformas enfrentarán un problema de integración. Un editor, escuela o empresa podría necesitar detectores y políticas separados para Claude, Gemini, ChatGPT y modelos más pequeños.
La interoperabilidad puede reducir esa carga. Sin embargo, los estándares compartidos también plantean cuestiones de gobernanza relacionadas con el acceso a detectores, la gestión de secretos, los umbrales, las apelaciones y las pruebas independientes.
Los modelos de código abierto añaden otra complicación. Un distribuidor puede activar una marca de agua, pero un usuario que controle los pesos del modelo y el software de inferencia puede eliminar ese comportamiento.
Los servicios cerrados pueden aplicar el marcado de manera más consistente porque los usuarios no controlan el proceso de generación. Esa diferencia corre el riesgo de crear expectativas de cumplimiento desiguales entre los sistemas alojados y los autogestionados.
También existe un problema de atribución. Una marca detectable puede identificar la participación de una familia de modelos sin revelar el flujo de trabajo humano que la rodea.
Un empleado de comunicaciones podría redactar un comunicado y pedir a Claude que corrija la puntuación. Un traductor podría usar Claude para un párrafo. Un desarrollador podría aceptar solo varias líneas de una respuesta generada mucho más extensa.
La detección no puede, por sí sola, reconstruir esas decisiones. No puede determinar si una persona aprobó cada afirmación ni si el modelo originó el argumento del documento.
Por tanto, las organizaciones necesitan registros del flujo de trabajo junto con señales a nivel de salida. Un proceso estructurado de gestión del conocimiento puede preservar fuentes, borradores, aprobaciones e historial de revisiones cuando la autoría importa.
Las marcas de agua cubren una parte de ese registro. Ofrecen a los investigadores otra pista legible por máquinas. No sustituyen la documentación sobre prompts, ediciones, revisión humana o responsabilidad de publicación.
Una Marca Detectada No Es Prueba de Autoría por IA
El mayor riesgo no es que la marca de agua falle siempre, sino que las personas traten una señal incierta como un veredicto definitivo.
Anthropic advierte que el texto marcado puede comenzar como escritura humana. Si Claude corrige, reformatea o traduce un pasaje, la versión devuelta puede contener la firma estadística del modelo.
Ese resultado no significa que Claude haya originado el argumento, la investigación o los hechos subyacentes. Significa que el modelo participó en la producción de la secuencia inspeccionada.
La inferencia inversa también falla. La ausencia de una marca no demuestra que una persona haya escrito el texto. El pasaje podría ser demasiado corto, estar muy editado, traducido o generado por un modelo sin marca.
Estas limitaciones son importantes en escuelas y lugares de trabajo, donde el resultado de un detector puede desencadenar acusaciones. Una señal probabilística no debería convertirse en la única base para una sanción, un despido o una conclusión de plagio.
El problema se parece a los clasificadores existentes de escritura por IA, pero las marcas de agua tienen una base técnica más sólida cuando el proveedor controla la generación. Un detector puede buscar un patrón incorporado deliberadamente en lugar de adivinar a partir del estilo de escritura.
Aun así, el detector debe operar con un umbral. Establecer un umbral estricto puede dejar pasar texto marcado. Reducirlo puede aumentar las alertas falsas relacionadas con material sin marca o escrito por humanos.
La investigación independiente ofrece motivos para la cautela. Un preprint de julio de 2026 evaluó implementaciones de tres métodos de marcas de agua de texto bajo un marco propuesto de preparación forense.
Su evaluación forense informó altas tasas de falsos negativos en las configuraciones evaluadas. Los investigadores también encontraron alertas falsas e incertidumbre sustancial en su implementación de SynthID.
Esos resultados no deben considerarse una auditoría directa del sistema privado de Anthropic. Evaluaron implementaciones representativas y configuraciones experimentales específicas, no el detector de producción de Anthropic.
Sí muestran por qué las afirmaciones de despliegue necesitan evaluaciones reproducibles. El rendimiento depende de la longitud del texto, el idioma, el modelo, la intensidad de la marca de agua, los umbrales del detector, la edición y el conocimiento del atacante.
La calidad es otra cuestión abierta. Anthropic afirma que solo modifica expresiones sin importancia, pero la importancia puede depender del contexto.
Un sinónimo que funciona en texto de marketing podría introducir ambigüedad en un contrato. Un cambio de token que preserva la intención general de un programa aún podría romper la compilación o alterar el comportamiento en tiempo de ejecución.
Los modelos pueden evitar marcar fragmentos restringidos, pero cada excepción reduce la señal disponible. Un sistema que protege el lenguaje exacto debe reunir evidencia a partir de las partes flexibles restantes de una respuesta.
Los desarrolladores querrán resultados separados para prosa, código fuente, datos estructurados y documentos mixtos. Una única tasa media de detección ocultaría diferencias significativas entre esos formatos.
El uso multilingüe crea otro punto de presión. La traducción puede eliminar una marca de agua de origen, mientras que la generación directa en otro idioma requiere pruebas adecuadas para la tokenización y gramática de ese idioma.
La cuestión es especialmente importante para los modelos globales. El despliegue mundial de Anthropic extiende la función a idiomas y sistemas de escritura, no solo a la prosa en inglés.
Los adversarios también cuentan con opciones sencillas. Pueden pedir a otro modelo que reescriba la salida, traducirla dos veces o mezclarla con texto no relacionado.
Ninguna empresa de marcas de agua afirma que una sola señal pueda detener a un operador motivado. Google dice explícitamente que SynthID no está diseñado como una defensa completa contra adversarios decididos.
Esto no vuelve inútiles las marcas de agua. Muchos controles de seguridad elevan los costes o respaldan la identificación rutinaria sin derrotar a todos los atacantes.
Los filtros de spam dejan pasar algunos mensajes. Los metadatos resistentes a la manipulación pueden eliminarse. Los sistemas de autenticación pueden ser objeto de phishing. Su valor proviene del uso en capas, de limitaciones medidas y de respuestas adecuadas.
Las marcas de agua de texto deberían seguir el mismo modelo. Las plataformas pueden combinarlas con metadatos firmados, registros de cuentas, divulgaciones visibles, análisis de contenido e investigación humana.
Las empresas también deberían separar la procedencia de la veracidad. Un párrafo marcado puede contener información precisa, mientras que un párrafo humano sin marca puede contener desinformación.
La marca responde a una pregunta limitada sobre un proceso de generación. No valida citas, resuelve la titularidad de los derechos de autor ni establece la responsabilidad editorial.
Ese límite debe mantenerse claro en las interfaces de producto. Un detector debería informar confianza y limitaciones, no mostrar una declaración en rojo intenso de que el software “atrapó” a un autor usando IA.
Los mecanismos de apelación serán importantes allí donde las decisiones afecten a las personas. Los usuarios necesitan una forma de explicar la autoría mixta, la traducción, la asistencia de accesibilidad y los flujos de trabajo de edición.
Sin esas salvaguardas, la tecnología de procedencia puede crear una nueva categoría de falsa certeza. La respuesta regulatoria a los medios sintéticos introduciría entonces su propio problema de confianza.
Qué Observar Tras el Despliegue de Marcas de Agua de Anthropic
Tres señales determinarán si el marcado estadístico de texto se convierte en una infraestructura útil o en otra función de detección frágil.
La primera señal es la realización de pruebas independientes sobre las marcas de agua de texto de Anthropic. Los investigadores necesitan acceso autorizado a herramientas de detección, protocolos de evaluación y muestras representativas de modelos marcados.
Las pruebas deberían informar resultados en distintas longitudes de respuesta, idiomas, código, respuestas factuales, prosa creativa, traducción, resumen y documentos mixtos de humanos y máquinas. También deberían publicar tasas de falsos positivos y falsos negativos.
Resultados sólidos en esos contextos respaldarían la afirmación de Anthropic de que las elecciones de palabras sin importancia proporcionan una señal útil. Un rendimiento débil fuera de la prosa inglesa extensa limitaría el papel práctico de la función.
La segunda señal es la interoperabilidad entre Anthropic, Google, OpenAI, plataformas y organismos de normalización. Una marca de agua tiene alcance limitado si solo su creador puede detectarla mediante un proceso privado.
El acceso seguro a detectores crea un equilibrio difícil. El acceso amplio ayuda a editores e investigadores, pero una divulgación detallada puede ayudar a los atacantes a identificar y eliminar la señal.
El mercado necesita un modelo de confianza viable. Los verificadores aprobados podrían recibir servicios de detección autenticados sin recibir el material secreto utilizado durante la generación.
Las alianzas de Google en torno a SynthID apuntan a una adopción más amplia, mientras que C2PA ofrece un marco complementario para la procedencia de archivos firmados. El texto aún necesita convenciones para informar la confianza y la autoría mixta.
Si los proveedores publican salidas compatibles y reglas de evaluación comunes, el Artículo 50 puede impulsar la procedencia hacia la infraestructura. Los detectores privados fragmentados debilitarían ese resultado.
La tercera señal es la aplicación de la normativa tras el período de transición para los modelos más antiguos. Los proveedores tienen hasta el 2 de diciembre de 2026 para incorporar los sistemas heredados elegibles al nuevo marco.
Los reguladores tendrán que aclarar qué significan en la práctica “detectable” y “técnicamente viable”. Esas definiciones determinarán si las marcas débiles cumplen la ley o si se exige una resiliencia medible.
Las decisiones de aplicación también mostrarán cómo tratan las autoridades a los modelos de código abierto, las respuestas breves, el código y los servicios construidos sobre API de terceros. Cada caso desafía una regla simple centrada en el proveedor.
La convergencia entre Anthropic y Google ya ha establecido una dirección importante. La procedencia legible por máquinas está pasando de la investigación voluntaria de seguridad a la arquitectura normal de producto.
Lo que sigue sin resolverse es el peso probatorio de esa procedencia. Una señal detectable puede respaldar una investigación, pero no puede narrar la historia completa de un documento.
Las organizaciones deberían prepararse antes de que los detectores se vuelvan habituales. Necesitan políticas que distingan la generación por IA, la asistencia de IA, la revisión humana y la responsabilidad editorial final.
Deberían conservar borradores y fuentes cuando la atribución tenga consecuencias legales, académicas o reputacionales. También deberían prohibir los castigos automatizados basados en el resultado de un solo detector.
Para los usuarios cotidianos, la pregunta práctica es simple: ¿te sentirías cómodo si un pasaje de Claude copiado llevara una señal detectable después de salir del chat?
Si la respuesta depende del contexto, registra ese contexto. Conserva el borrador humano, verifica las afirmaciones, divulga la generación sustancial cuando sea necesario y trata cualquier marca de agua de Anthropic o Google como evidencia, no como veredicto.


