AHORA
Nuevo proyecto de Ley de Protección de Datos Personales en Argentina: análisis completo Colombia actúa donde Argentina falla: la SIC sanciona a empresa por filtración Microsoft patches récord: 570 vulnerabilidades corregidas en julio 2026 DGL Talent: primera firma de talento en datos, privacidad y ciber de LATAM Nuevo proyecto de Ley de Protección de Datos Personales en Argentina: análisis completo Colombia actúa donde Argentina falla: la SIC sanciona a empresa por filtración Microsoft patches récord: 570 vulnerabilidades corregidas en julio 2026 DGL Talent: primera firma de talento en datos, privacidad y ciber de LATAM

Anthropic marca textos de Claude — y aparecen herramientas sin prueba de que funcionen

Días después del anuncio de watermarking, surgieron servicios que prometen evadir la detección sin que nadie pueda verificar si realmente lo logran.
Alerta

Días después del anuncio de watermarking, surgieron servicios que prometen evadir la detección sin que nadie pueda verificar si realmente lo logran.

Anthropic comenzó a aplicar watermarks a los textos generados por Claude, una medida técnica para identificar contenido producido por su modelo de lenguaje. La respuesta del ecosistema fue inmediata: en cuestión de días aparecieron múltiples herramientas que prometen remover esas marcas, incluyendo un proyecto open source que ya acumula más de 4500 estrellas en GitHub y servicios pagos que ofrecen evasión de detección de IA. El problema es que ninguna de estas herramientas puede demostrar que realmente funciona, porque Anthropic no lanzó un detector público que permita verificar si el watermark sigue presente después del procesamiento.

El watermark que nadie puede confirmar que removió

El watermarking de texto es una técnica que inserta patrones estadísticos imperceptibles en la salida de un modelo de lenguaje, permitiendo identificar posteriormente si un fragmento fue generado por esa IA específica. Anthropic implementó esta funcionalidad en Claude sin publicar detalles técnicos sobre cómo funciona ni ofrecer una herramienta pública de detección. Esa opacidad crea un vacío de verificabilidad: cualquier servicio puede afirmar que remueve el watermark de Claude, pero no existe forma externa de comprobar si la afirmación es cierta.

Los proyectos que surgieron después del anuncio de Anthropic incluyen tanto repositorios de código abierto como plataformas comerciales. El proyecto open source con mayor tracción en GitHub presenta técnicas de reescritura y parafraseo que, en teoría, podrían alterar los patrones estadísticos del watermark. Los servicios pagos, por su parte, prometen evasión de múltiples sistemas de detección de IA, no solo el de Claude. Ninguno de ellos puede presentar evidencia empírica de efectividad contra el watermark específico de Anthropic, porque esa evidencia requeriría acceso al detector que Anthropic mantiene privado.

Por qué la ausencia de detector público importa más allá de la verificación

La decisión de Anthropic de no publicar un detector de watermarks tiene implicancias que van más allá de la imposibilidad de auditar las herramientas de remoción. Sin un detector público, instituciones educativas, medios de comunicación y empresas que quisieran verificar si un texto proviene de Claude no tienen forma de hacerlo por cuenta propia. Esto contrasta con otros enfoques de detección de contenido generado por IA, donde la disponibilidad de herramientas de verificación permite que terceros evalúen tanto la efectividad del sistema como la de las técnicas de evasión.

La proliferación de servicios de remoción sin capacidad de verificación crea un mercado basado en afirmaciones no comprobables. Un usuario que paga por un servicio de evasión de watermarks no tiene forma de saber si el procesamiento realmente eliminó la marca o si simplemente reescribió el texto sin alterar el patrón estadístico que Anthropic insertó. En América Latina, donde universidades y empresas están adoptando políticas sobre uso de IA generativa, esta opacidad complica la implementación de controles: no existe forma técnica de confirmar si un documento fue producido por Claude, ni siquiera para quienes contratan servicios especializados de detección.

El patrón de carrera armamentista sin árbitro técnico

Publicidad728×90 — In-Article

La dinámica que se observa con el watermark de Claude replica un patrón conocido en otros dominios de seguridad: una medida de control genera inmediatamente un mercado de evasión, pero en este caso la ausencia de un árbitro técnico público impide que el ciclo de mejora iterativa funcione de forma transparente. En sistemas de detección de malware o de spam, la disponibilidad de herramientas de análisis permite que investigadores independientes evalúen tanto las defensas como las técnicas de evasión, generando conocimiento público sobre qué funciona y qué no.

Con el watermark de Claude, ese ciclo está roto desde el inicio. Los desarrolladores de herramientas de remoción no pueden testear sus técnicas contra el sistema real, solo pueden aplicar heurísticas generales de reescritura y esperar que alteren suficientemente el texto como para romper cualquier patrón estadístico. Anthropic, por su parte, no tiene incentivo para publicar un detector que permitiría a terceros evaluar la robustez de su watermark, porque esa publicación facilitaría el desarrollo de técnicas de evasión más efectivas. El resultado es un mercado donde tanto la efectividad de la marca como la de su remoción son afirmaciones sin evidencia pública.

Nuestro análisis

El caso del watermark de Claude expone una tensión estructural en el diseño de controles sobre contenido generado por IA: la efectividad de una marca de agua depende de que sea difícil de remover, pero la verificabilidad de esa efectividad requiere transparencia que facilita la evasión. Anthropic eligió priorizar la opacidad sobre la auditabilidad, apostando a que la falta de información técnica pública dificulte el desarrollo de contramedidas efectivas. Esa apuesta tiene un costo: sin un detector público, el watermark no puede cumplir funciones de verificación para terceros, solo para Anthropic misma.

Lo que queda por ver es si otros proveedores de modelos de lenguaje adoptarán el mismo enfoque o si optarán por publicar detectores que permitan auditoría externa a cambio de aceptar que esa transparencia acelere el desarrollo de técnicas de evasión. Mientras tanto, el mercado de herramientas de remoción de watermarks seguirá creciendo sobre afirmaciones que nadie puede verificar. ¿Cuánto tiempo puede sostenerse un sistema de control cuya efectividad es, por diseño, imposible de auditar desde afuera?

Publicidad728×90 — In-Article
Publicidad300×250 — Medium Rectangle

El briefing semanal

Seguridad, privacidad e IA en LATAM. Curado por expertos, gratis cada semana.

Publicidad300×600 — Half Page
Publicidad970×90 — Leaderboard