Una investigación de Adversa AI ha demostrado una cadena de ataque contra la navegación asistida de Grok capaz de extraer información privada sin pedir una confirmación adicional al usuario. La técnica, bautizada como Cryptographic Context Injection, oculta instrucciones dentro de texto cifrado para que los filtros de entrada no puedan analizarlas y fuerza su descifrado en el entorno de ejecución de código del propio agente.
El ataque es indirecto: la carga se aloja en una página externa y se activa cuando alguien solicita a Grok que la resuma o analice. Por eso «zero-click» no significa que la víctima no haga nada, sino que, tras esa petición normal, la salida de datos se produce sin otro clic, aviso visible ni autorización. Los investigadores no han publicado las cargas operativas.
Del contenido cifrado a una herramienta con acceso a Internet
La diferencia frente a una inyección de instrucciones convencional está en el recorrido. Un clasificador puede inspeccionar texto, pero no ejecutar por sí mismo operaciones criptográficas. En la demostración se emplean AES-256-GCM y una clave derivada mediante PBKDF2: el agente lleva el material a su intérprete, recupera allí las instrucciones y trata el resultado como si procediera de su propio entorno de confianza.

Una vez descifrada, la instrucción hace que Grok construya una petición hacia un servidor controlado por el atacante. Según la prueba, los parámetros podían incorporar el nombre, la ubicación aproximada, el nivel de suscripción y todos los mensajes del usuario en la conversación activa. No equivale a afirmar que pueda descargar cualquier dato de la cuenta: el alcance documentado es el contexto privado que el agente resolvió durante esa sesión.
El punto crítico no es una rotura de AES, sino la ausencia de separación entre datos e instrucciones. El contenido de una web no fiable termina guiando una herramienta privilegiada con salida a Internet. Es un problema distinto de vulnerabilidades de software tradicionales, como los fallos graves de Citrix NetScaler alertados por INCIBE-CERT: aquí la cadena aprovecha las decisiones y permisos del armazón que rodea al modelo.
Seguía siendo reproducible el 19 de agosto
Adversa AI asegura que notificó el hallazgo a xAI y a su programa de recompensas de HackerOne el 3 de junio de 2026. La empresa acusó recibo, pero no proporcionó detalles ni un calendario de mitigación. Los investigadores intentaron retomar la coordinación los días 4 y 10 de agosto y, en el momento de publicar su análisis, afirmaban no haber recibido respuesta adicional.
La prueba todavía funcionaba contra Grok el 19 de agosto, un día antes de la divulgación. Esa fecha es importante: describe el estado comprobado por el equipo, no garantiza que la técnica siga operativa en todas las cuentas o versiones posteriores. No consta en la fuente una corrección confirmada por xAI, por lo que conviene evitar conclusiones sobre un parche mientras no exista una comunicación técnica oficial.
Qué pueden hacer usuarios y responsables de agentes
Para el usuario, la precaución más inmediata es no pedir a un asistente con herramientas que analice páginas desconocidas cuando la sesión contiene conversaciones sensibles. También conviene separar tareas: una sesión destinada a consultar contenido externo no debería conservar información privada innecesaria ni disponer de permisos que no vaya a usar.
La mitigación de fondo corresponde al diseño del agente. Adversa AI recomienda procesar el contenido no fiable en un contexto sin credenciales ni herramientas, conservar su procedencia y trasladar al entorno privilegiado únicamente datos estructurados. Las llamadas a destinos nuevos, publicaciones, escrituras y otras acciones externas deberían exigir aprobación con los argumentos ya resueltos, no con plantillas que oculten qué información saldrá.
También propone registrar las llamadas a herramientas y detectar secuencias completas: entrada de contenido externo, ejecución de código y conexión posterior a un dominio ajeno. Bloquear solo cadenas cifradas no resolvería el problema; la defensa debe impedir que un resultado derivado de una fuente no fiable herede automáticamente la confianza y los privilegios del agente.








