El nuevo ataque BioShocking engaña a los navegadores de IA para que filtren las credenciales de los usuarios – CYBERDEFENSA.MX

Convenza a un navegador de IA de que está jugando y podrá entregarle sus datos de inicio de sesión. Ese es el hallazgo detrás BioShockinguna técnica de la firma de seguridad LayerX que engañó a seis navegadores y asistentes de inteligencia artificial para que copiaran las credenciales de un usuario y las enviaran a un atacante.

Los objetivos incluían ChatGPT Atlas de OpenAI, Comet de Perplexity y la extensión del navegador Claude de Anthropic.

Un navegador con IA es aquel que puede actuar por usted, no solo leer páginas. Cámbielo al modo de agente y podrá hacer clic, escribir y acceder a los sitios en los que ya ha iniciado sesión. Ese acceso es el objetivo y también es el problema.

Ciberseguridad

El truco funciona debido a la forma en que leen estos agentes. La página web y sus propias instrucciones llegan como un único flujo de texto. Eso permite que una página maliciosa introduzca comandos disfrazados de contenido ordinario o reglas de juego, y el agente no puede notar la diferencia de manera confiable. Los investigadores llaman a esto inyección rápida indirecta.

Cómo funciona el truco

El ataque comienza con una página web construida a modo de rompecabezas. Para encajar con su tema distópico, el rompecabezas recompensa las respuestas incorrectas, como insistir en que 2 + 2 = 5. Una vez que el agente acepta que «incorrecto» es el movimiento ganador, sigue la lógica del juego en lugar de la lógica de seguridad. El paso final del rompecabezas le pide que obtenga las credenciales del usuario, y ninguno de los seis agentes señaló que esto fuera algo que debiera rechazar.

La parte peligrosa es donde mira el agente. En la prueba, se envió un enlace al repositorio GitHub del trabajo de la víctima, de donde extrajo las credenciales de inicio de sesión SSH y se las pasó al atacante.

CapaX usó un archivo de texto sin formato inofensivo, pero el mismo truco podría indicarle al agente otros recursos a los que puede acceder en esa sesión: pestañas abiertas, cuentas iniciadas y herramientas internas. El agente no dudó. Posteriormente, informó alegremente del robo como una victoria.

El nombre hace un guiño a BioShock, donde un personaje con el cerebro lavado obedece la frase desencadenante «¿Sería tan amable?» El agente no es diferente. Confía en el contexto que se le presenta. Cambie el contexto y cambiará lo que hará.

LayerX ha mostrado este patrón antes, demostrando que un solo clic podría secuestrar el cometa Perplexity y robar datos silenciosamente.

Qué hicieron los vendedores y qué hacer

Según LayerX, las respuestas fueron desiguales. Informó el problema a los proveedores entre octubre de 2025 y enero de 2026. OpenAI lo solucionó en ChatGPT Atlas. Perplejidad cerró el informe sin actuar al respecto.

Fellou, Genspark y Sigma no respondieron. Anthropic intentó parchear su extensión Claude, pero LayerX dice que la solución no funcionó.

Para detener el ataque, LayerX quiere que los navegadores de IA pregunten antes de leer desde las cuentas iniciadas. Un mensaje, «Estoy a punto de copiar datos de su repositorio de GitHub. ¿Continuar?», rompería la cadena.

Ciberseguridad

También quiere que los agentes se den cuenta cuando una página les dice que las reglas normales ya no se aplican y permitir a los usuarios establecer límites estrictos sobre lo que un agente puede tocar. Ganar un juego no es motivo para abrir un repositorio privado.

Para los usuarios, los consejos son más breves. Trate el modo agente con cuidado: cualquier cosa en la que haya iniciado sesión es un juego limpio, así que decida qué debe ver el navegador y corte ese acceso cuando haya terminado. Para los equipos de seguridad, la misma lógica se aplica.

Un navegador de IA en modo agente es efectivamente otra cuenta con acceso a los sistemas de la empresa, y debería obtener el acceso más estrecho que una tarea necesita en lugar de un pase permanente a todo lo que el usuario puede tocar.

El hilo conductor de estos hallazgos es que entregarle a un agente de inteligencia artificial las claves de sus cuentas iniciadas convierte el jailbreak de un truco de fiesta en un acceso real.

El ataque de secuestro de agentes engaña a los agentes codificadores de IA para que ejecuten código malicioso – CYBERDEFENSA.MX

Los investigadores de ciberseguridad han descrito lo que dicen es una nueva clase de ataque que puede engañar a los agentes codificadores de inteligencia artificial (IA) para que ejecuten código arbitrario en las máquinas de los desarrolladores.

Llamado secuestro de agente Según Tenet Security, el ataque puede desencadenarse mediante un informe de error falso elaborado con Sentry, una plataforma de seguimiento de errores y monitoreo del rendimiento de código abierto.

«El ataque explota una falla arquitectónica crítica en la intersección de la ingestión de eventos de Sentry (que acepta cargas útiles arbitrarias de cualquier persona con el DSN) y el servidor Sentry MCP (que devuelve estos datos a los agentes de IA como salida confiable del sistema)», los investigadores de seguridad Ron Bobrov, Barak Sternberg y Nevo Poran dicho.

La idea es inyectar información diseñada en los eventos de error de Sentry, que luego son interpretados por agentes de codificación como Claude Code y Cursor como pasos legítimos de resolución de diagnóstico y ejecutan código controlado por el atacante.

Un ataque exitoso de este tipo puede exponer datos confidenciales, incluidas variables de entorno, credenciales de Git, URL de repositorios privados e identidades de desarrolladores, sin tener que depender de métodos como el phishing o el compromiso previo del servidor.

Ciberseguridad

El problema tiene su origen en la confianza implícita asociada con la conexión a servicios externos mediante el Protocolo de contexto modelo (MCP). Debido a que un agente de IA no puede distinguir entre un evento de error generado por una falla real de una aplicación o inyectado por un atacante, crea una vía para la ejecución de código arbitrario cuando el agente procesa la respuesta.

La cadena de ataque ideada por Tenet es la siguiente:

  • Un atacante encuentra el nombre de la fuente de datos Sentry de un objetivo (DSN), una credencial pública de solo escritura integrada en sitios web.
  • El atacante envía un evento de error malicioso al punto final de ingesta de Sentry a través de una solicitud POST utilizando el DSN.
  • El evento inyectado contiene «rebajas cuidadosamente formateadas» en el campo del mensaje y los nombres de las claves de contexto. Cuando el servidor Sentry MCP devuelve este evento a un agente de IA, se presenta como contenido estructurado visualmente idéntico a la plantilla del sistema Sentry.
  • Cuando un desarrollador le pide a su agente de codificación de IA que «solucione problemas de Sentry no resueltos» (o un mensaje similar), el agente consulta a Sentry a través de MCP y recibe el evento malicioso.
  • El agente ejecuta código malicioso, que se ejecuta con todos los privilegios del desarrollador.

«El atacante nunca toca la infraestructura de la víctima», explicaron los investigadores. «La instrucción maliciosa llega disfrazada de una ‘Resolución’ legítima dentro de un error ordinario. Cuando un desarrollador le pide a su agente de IA que solucione el problema de Sentry, el agente lee el comando del atacante como una guía confiable y lo ejecuta, con los propios privilegios del desarrollador, en la propia máquina del desarrollador».

Agentjacking se destaca porque se dirige al agente de IA en el que confía un desarrollador y utiliza un Sentry DSN como punto de partida. Además, la inyección de rebajas se realiza de tal manera que el agente no puede distinguirla de la guía legítima de Sentry.

Ciberseguridad

La compañía de ciberseguridad de IA dijo que encontró al menos 2.388 organizaciones expuestas con DSN inyectables válidos y que probó el ataque de manera controlada contra más de 100 organizaciones, logrando una tasa de éxito de explotación del 85% contra errores inyectados en algunos de los asistentes de codificación de IA más utilizados.

Sentry, por su parte, reconoció el problema, pero optó por no solucionarlo, afirmando que «técnicamente no es defendible». Sin embargo, se dice que la compañía activó un filtro de contenido global que bloquea una «cadena de carga útil específica».

«A medida que las empresas se apresuran a implementar agentes de codificación de IA, esta investigación demuestra que los propios agentes ahora son la superficie de ataque, vueltos contra los desarrolladores que confían en ellos, utilizando nada más que datos que esas organizaciones publican sobre sí mismas», dijo Tenet. «El ataque evita EDR, WAF, IAM, VPN, Cloudflare y firewalls, porque no hay nada malicioso que detectar. Cada acción en la cadena está autorizada».