OpenAI añadirá una marca de agua invisible a los textos elegibles de ChatGPT y Codex en la Unión Europea, incluida España, durante las próximas semanas. La compañía anunció el 5 de octubre un despliegue que abarcará todos los planes, aunque todavía no está completado. La tecnología se llama textGrain y permitirá comprobar si un pasaje contiene su señal estadística.
La incorporación a ChatGPT y Codex responde, según OpenAI, a los requisitos de identificación automática del texto generado de la Ley de IA de la UE. Fuera de la Unión Europea, la empresa no la activará por defecto durante el lanzamiento. Los clientes de la API, la vía para integrar los modelos en otras aplicaciones, pueden optar por activarla en determinados modelos desde cualquier país; en la API permanece desactivada por defecto. OpenAI también trabaja para ofrecerla mediante sus socios de nube.
Una señal en las palabras, sin caracteres ocultos
textGrain actúa durante la redacción: introduce una señal estadística en la elección de palabras o fragmentos de palabras, llamados tokens. No añade caracteres ocultos, espacios invisibles ni puntuación especial. El informe técnico explica que esas elecciones están vinculadas a una clave secreta y al contexto previo del texto.
Para buscar la marca, el detector utiliza el pasaje y esa clave. No necesita el modelo que lo generó ni conocer la intensidad con la que se aplicó la señal. Su resultado indica si encuentra la marca, sin identificar al usuario ni revelar sus instrucciones o conversaciones.
El acceso a esa comprobación será limitado: OpenAI ha abierto solicitudes para investigadores y organizaciones especializadas aprobadas. El detector de texto no será público en el lanzamiento; las herramientas públicas de verificación de imágenes y audio son distintas.
La longitud y las ediciones afectan a la detección
Las evaluaciones de OpenAI muestran que el resultado depende del contenido y de su extensión. Con una tasa objetivo de falsos positivos del 1 %, el sistema detectó aproximadamente el 80 % de los pasajes de 200 tokens y el 95 % de los de 400 tokens en contenido como psicología. En matemáticas rindió bastante peor, porque existe menos margen para elegir palabras.
Editar el texto también debilita la señal. En otra prueba con pasajes de 400 tokens, sustituir por sinónimos el 10 % de las palabras redujo la detección de cerca del 92 % al 66 %. Al sustituir el 25 %, cayó al 17 %. Son resultados de las pruebas de la compañía, no una garantía aplicable a cualquier escrito.
La marca tiene un alcance concreto: encontrarla no demuestra autoría, titularidad, legalidad ni veracidad, y tampoco mide cuánto aportó una persona. Su ausencia no acredita un origen humano: puede tratarse de un texto corto, editado, traducido, anterior al despliegue o generado por un modelo no compatible.







