Las pruebas de codificación falsas generan malware alineado con OtterCookie oculto en imágenes de banderas SVG – CYBERDEFENSA.MX

Se ha observado que los actores de amenazas norcoreanos vinculados a la campaña Contagious Interview emplean esteganografía en archivos de imágenes SVG para ocultar cargas útiles maliciosas como parte de una campaña que utiliza ofertas de trabajo falsas y desafíos de codificación.

«Cualquier usuario que ejecutara el proyecto terminó con una carga útil de cuatro etapas alineada con OTTERCOOKIE: un ladrón de credenciales de navegador y billeteras criptográficas, un ladrón de archivos, un troyano de acceso remoto (RAT) basado en Socket.IO y un ladrón de portapapeles», Elastic Security Labs dicho en un informe compartido con The Hacker News.

Los hallazgos resaltan una vez más el continuo ataque a los desarrolladores de software por parte de piratas informáticos patrocinados por el Estado alineados con la República Popular Democrática de Corea (RPDC) con el objetivo de robar datos confidenciales y saquear carteras de criptomonedas. La actividad está siendo rastreada bajo el nombre de REF9403.

El brazo de ciberseguridad de la plataforma holandesa de búsqueda y observabilidad empresarial dijo que descubrió la campaña después de que los actores de amenazas atacaran a miembros de su espacio de trabajo comunitario de Slack con señuelos de ingeniería social para supuestas ofertas de trabajo, destacando una nueva vía de acceso inicial no documentada previamente en ataques asociados con Contagious Interview, una sofisticada operación de ingeniería social en curso desde al menos diciembre de 2022.

Los mensajes, publicados por un usuario llamado Maxwell en el canal #jobs Slack a finales de mayo de 2026, buscaban un desarrollador experimentado para ayudar a actualizar su plataforma de comercio electrónico a una «arquitectura moderna y escalable que utiliza Next.js (v14), NestJS, PostgreSQL y Auth.js» junto con la integración de Stripe.

Ciberseguridad

Aquellos que expresaron interés en la oportunidad recibieron mensajes directos que les indicaban que completaran una evaluación de codificación como parte de la oferta de trabajo, una táctica estándar observada en las campañas de entrevistas contagiosas. La tarea implicó ejecutar un repositorio troyanizado que contenía malware diseñado para filtrar datos valiosos y configurar una puerta trasera Socket.IO.

Específicamente, los repositorios distribuidos como parte del esquema incorporan código completamente funcional pero también incorporan código malicioso en forma de imágenes SVG para evitar la detección.

«Si bien estos proyectos aparentemente legítimos funcionan perfectamente bien, el código malicioso se activa silenciosamente detrás de escena», dijo Elastic. «Las cargas útiles se dividen en fragmentos base64 dentro de comentarios HTML en cada imagen de bandera SVG dentro de un directorio de activos. Estos archivos parecen ser imágenes normales de banderas de países (AE.svg, AF.svg), pero cada archivo contiene un bloque de comentarios inyectado con datos codificados en Base64».

Luego, la carga útil se ensambla mediante un archivo JavaScript («serverValidation.js») presente en el repositorio. La cadena de ataque está diseñada de tal manera que el malware se ejecuta en cada inicio del servidor. Elastic dijo que las principales cargas útiles se superponen con OtterCookie, un malware multiplataforma que surgió por primera vez en septiembre de 2024.

OtterCookie «evolucionó de una herramienta básica para ejecutar comandos remotos y buscar claves criptográficas a un programa modular capaz de realizar un robo de datos más amplio con capacidad para verificar entornos de VM, instalar clientes de comunicación como socket.io para C2, filtrar información, ejecutar comandos de shell arbitrarios, cargar otros módulos para recopilar datos específicos e informar los resultados», Microsoft anotado allá por marzo.

Ciberseguridad

El malware incorpora cuatro módulos distintos que le permiten recopilar datos de navegadores web y carteras de criptomonedas, recopilar archivos que coincidan con una lista específica de extensiones, facilitar el control remoto persistente utilizando un troyano basado en Socket.IO que puede ejecutar comandos de shell, capturar contenido del portapapeles y soltar ejecutables de Windows.

Entre los archivos recopilados por OtterCookie se incluyen extensiones de herramientas de codificación de inteligencia artificial (IA) como .claude, .cursor, .gemini, .windsurf, .pearai y .llama, lo que sugiere que el actor de amenazas está refinando activamente su arsenal para aspirar la mayor cantidad de información posible.

Vale la pena señalar que el malware también muestra algunas superposiciones funcionales con un ladrón de datos y un troyano distribuido a través de paquetes npm falsos disfrazados de herramientas Rollup polyfill, lo que sugiere que los actores de la amenaza están buscando múltiples vectores de propagación.

«Esta campaña refuerza el hecho de que los desarrolladores siguen siendo un objetivo principal, donde el compromiso de un solo individuo puede proporcionar el acceso inicial necesario para permitir ataques de gran alcance a la cadena de suministro contra organizaciones posteriores», dijo Elastic. «El éxito de estas operaciones subraya cómo comprometer a un desarrollador individual puede proporcionar un camino hacia un impacto organizacional mucho más amplio».

Las fallas en los enlaces simbólicos de GhostApproval podrían permitir que los repositorios maliciosos ejecuten código en agentes de codificación de IA

Investigadores de Fenómeno descubrió que una falla en seis populares asistentes de codificación de IA permite que un proyecto de código trampa tome silenciosamente el control de la computadora de un desarrollador. El asistente pide permiso para editar un archivo que parece inofensivo, pero la escritura llega a uno sensible.

Las herramientas afectadas son Amazon Q Developer, Claude Code de Anthropic, Augment, Cursor, Google Antigravity y Windsurf. Wiz llama al patrón Aprobación fantasma y lo publicó el 8 de julio.

Tres de los seis han enviado correcciones, dos no, y Anthropic niega que se trate de un error. Las más expuestas son las herramientas que cambian archivos antes de que puedas intervenir.

Cómo funciona el ataque

El ataque abusa de una antigua característica de Unix llamada enlace simbólicoo enlace simbólicoque los asistentes no logran comprobar. Un enlace simbólico apunta silenciosamente a otro archivo en otra parte del disco, por lo que escribir en él en realidad escribe en el destino.

Wiz creó un repositorio malicioso con un enlace simbólico llamado project_settings.json que realmente apunta al archivo de inicio de sesión SSH de la víctima, ~/.ssh/authorized_keys. El archivo README del repositorio le dice al asistente que agregue «una línea» a project_settings.json, y esa línea es la clave SSH del atacante vestida como una configuración inofensiva.

Pídale al agente que «configure el espacio de trabajo» o «siga el archivo README» y escribirá la clave directamente a través del enlace simbólico en el archivo de inicio de sesión. A partir de ahí, si la máquina ejecuta un servicio SSH al que el atacante pueda acceder, podrá iniciar sesión sin contraseña.

Una segunda versión del truco escribe en el archivo de inicio de su shell, ~/.zshrc, que el shell ejecuta la próxima vez que abre una terminal, por lo que no se necesita SSH. No hay señales de que nada de esto haya sido utilizado en ataques reales; Wiz lo presenta como investigación.

El cuadro de aprobación muestra algo incorrecto

Los trucos de enlaces simbólicos tienen décadas de antigüedad. El enlace simbólico es sólo la entrega; el verdadero fracaso es el cuadro de aprobación. En GhostApproval, se encuentra ese cuadro.

Al probar Claude Code, Wiz descubrió que el agente ya había detectado el objetivo real en su propio razonamiento, y señaló que project_settings.json era, en sus palabras, «en realidad un archivo de configuración zsh». Sin embargo, el cuadro mostrado al desarrollador solo mencionaba el archivo inofensivo.

Ciberseguridad

Hace clic en Aceptar, creyendo que está editando un archivo de configuración local, y la escritura llega a su archivo de inicio de shell o a sus claves SSH. Wiz llama a esto un bypass de consentimiento informado: el humano todavía está en el bucle, pero el bucle les muestra algo incorrecto.

Algunas herramientas son peores: saltan la puerta por completo, por lo que nunca hay un momento para intervenir. Windsurf escribe el archivo en el disco antes de que aparezcan los botones Aceptar y Rechazar, por lo que el mensaje es solo un botón deshacer y la clave ya está en su lugar.

Augment no muestra ningún diálogo y Wiz lo demostró en silencio, leyendo un archivo de credencial de AWS que se encontraba fuera del proyecto. Sin embargo, las herramientas que todavía muestran un mensaje no son más seguras; el mensaje simplemente nombra el archivo incorrecto.

¿Qué herramientas se ven afectadas?

Wiz informó del problema a los seis proveedores. Aquí es donde se encuentra cada uno al momento de la publicación:

Herramienta Estado que hacer
Desarrollador de Amazon Q Corregido en el servidor de idiomas 1.69.0 (CVE-2026-12958) Actualizar. Se instala automáticamente para la mayoría de los usuarios y al volver a cargar el IDE se activa.
Cursor Fijado en v3.0 (CVE-2026-50549) Actualización desde el administrador de extensiones.
Antigravedad de Google Fijo (CVE pendiente) Actualizar a la versión actual.
Aumentar Admitido; aún no hay solución No apuntes a repositorios en los que no confíes.
windsurf Admitido; aún no hay solución No apuntes a repositorios en los que no confíes.
Código Claude antrópico Cuestionado; Las versiones actuales advierten. Actualice y lea la advertencia del enlace simbólico antes de aceptar.

Anthropic rechazó la clasificación y le dijo a Wiz que el escenario se encuentra «fuera de nuestro modelo de amenaza»: el desarrollador eligió confiar en la carpeta al iniciar la sesión y luego aprobó la edición, por lo que la decisión fue suya.

También dijo que la advertencia de enlace simbólico de Claude Code se envió a principios de febrero, antes del informe privado de Wiz, como un refuerzo de rutina en lugar de una solución, y que un «sin comentarios» anterior era una respuesta automática.

De los seis proveedores, Anthropic es el único que dice que esto no es un error; Se enviaron tres correcciones y dos están trabajando en ellas. Sin embargo, la pregunta que plantea su postura es real, y no solo Anthropic debe responder: ¿hasta dónde debe llegar un agente de codificación para proteger a un desarrollador que ya ha confiado en un repositorio malicioso?

Más allá de los parches, algunos hábitos reducen el riesgo, independientemente de la herramienta que utilice. Ejecute el agente con acceso limitado a archivos o dentro de un entorno limitado o contenedor. Revise el archivo README de un repositorio y los archivos de configuración ocultos antes de permitir que un agente lo «configure».

Y después de trabajar en un repositorio desconocido, verifique los archivos a los que se dirige el ataque, que se encuentran fuera del proyecto y, por lo tanto, no aparecerán en el estado de git: su archivo de inicio de shell, sus claves SSH y la propia configuración de su herramienta de inteligencia artificial. Verificar sus marcas de tiempo, por ejemplo, con ls -la ~/.zshrc ~/.ssh/authorized_keys, muestra si algo cambió mientras el agente se estaba ejecutando.

Ciberseguridad

El consejo de Wiz para los fabricantes de herramientas es breve: resuelva el enlace simbólico y muestre el destino real antes de preguntar, marque cualquier escritura que termine fuera de la carpeta del proyecto y nunca toque el disco hasta que el usuario lo haya aprobado.

Un defecto compartido, no el desliz de un proveedor

En mayo, Adversa AI publicó SymJackel mismo patrón de enlace simbólico y aprobación contra seis agentes de codificación, incluidos Claude Code, Cursor, GitHub Copilot y Grok Build.

Dos equipos independientes descubrieron que esto apunta a una debilidad de diseño compartida, no a un desliz de un proveedor: estos agentes siguen un enlace simbólico utilizando operaciones de archivos ordinarias, luego solicitan aprobación según la ruta que se les entregó, no la ruta en la que llega la escritura.

El solapamiento llega incluso al CVE. El propio aviso de Cursor por su error de enlace simbólico acredita tanto a Wiz como a Cato AI Labs, cuyo trabajo anterior The Hacker News cubrió como DuneSlide.

Los archivos en los que confía un asistente de IA ya no son solo código. Para estos agentes, sirven también como instrucciones que el agente sigue y caminos que sigue, y dan forma a lo que muestra el cuadro de aprobación. El boletín de AWS también cubre una falla separada de Amazon Q, CVE-2026-12957, donde un repositorio envenenado podría cargar automáticamente un archivo de configuración y ejecutar comandos para robar las claves de AWS de un desarrollador una vez que se confiaba en el espacio de trabajo.

La técnica exacta de GhostApproval todavía está bajo investigación, pero el patrón más amplio ya está apareciendo en la naturaleza: repositorios que contienen archivos que dirigen a los agentes de IA a comportamientos inseguros.

Como informó THN ​​en junio, el gusano Miasma colocó archivos de configuración de agentes de IA en un repositorio de Microsoft Azure para que su carga útil se ejecutara en el momento en que un desarrollador abriera el proyecto en Claude Code, Cursor o Gemini. En respuesta, GitHub deshabilitó los 73 repositorios de Microsoft afectados.

«Human in the loop» sólo te protege si el loop dice la verdad. A medida que estos asistentes obtienen más libertad para leer y escribir archivos por su cuenta, un cuadro de aprobación que nombra el destino incorrecto no es una protección sino una responsabilidad, y tratar un repositorio engañoso como un problema puramente del usuario pone el peso en la persona que tiene menos capacidad para ver el intercambio.

Se encontraron agentes de codificación de IA que activan reglas de seguridad de endpoints diseñadas para atrapar a los atacantes – CYBERDEFENSA.MX

Sophos analizó una semana de datos de sus propios terminales y descubrió que agentes de codificación de IA como Claude Code, Cursor y OpenAI Codex están activando reglas de detección escritas para atrapar a intrusos humanos.

Los agentes no son maliciosos. Simplemente hacen muchas cosas que, para un motor de comportamiento, parecen exactamente un ataque.

Descifrar las credenciales del navegador, enumerar lo que se encuentra en el almacén de credenciales de Windows, extraer archivos con herramientas integradas del sistema, escribir en la carpeta de inicio: estas han sido durante mucho tiempo una señal importante para los defensores.

Lo que ha cambiado es quién lo genera. En las máquinas que observaba Sophos, a menudo era el asistente de inteligencia artificial de un desarrollador realizando el trabajo ordinario.

¿Qué hizo saltar las alarmas?

El análisis Se basa en siete días de telemetría de junio de 2026, tomados del motor de comportamiento de Sophos en Windows y contados por máquinas únicas, no por volumen de eventos sin procesar. Es una ventana estrecha sobre la flota de un proveedor, no un censo de la industria.

Los gráficos de Sophos sitúan el acceso a credenciales en el 56,2 por ciento de la actividad bloqueada y la ejecución en el 28,8 por ciento: agentes buscando secretos almacenados o ejecutando código como lo hacen los atacantes.

La mayor regla de acceso a credenciales, con un 42,6 por ciento de ese grupo, se activa cuando un proceso utiliza la API de protección de datos integrada de Windows, o DPAPI, para descifrar los datos de credenciales almacenados en el navegador. Sophos llama a GStack un paquete de habilidades ampliamente adoptado para agentes de codificación.

Ciberseguridad

Su habilidad /browse hace exactamente eso, ejecutando PowerShell que llama a DPAPI para desbloquear los datos guardados del navegador. Sophos lo detectó ejecutándose bajo Claude Code. En contexto, es casi seguro que se trata de una automatización del navegador en nombre del usuario. Para el motor de detección, se trata de robo de credenciales y la regla es despedir.

Algunos ejemplos de Python se veían peor en el papel. En un caso, Claude Code cerró el navegador en ejecución y ejecutó un script que extraía datos de su almacén de credenciales.

Por separado, ejecutó cmdkey /list para enumerar las credenciales que tenía Windows Credential Manager. Sophos señala que Claude Code se ejecutó aquí con su indicador –dangerfully-skip-permissions establecido, un modo contra el cual la propia documentación de Anthropic advierte e indica a los administradores cómo bloquear.

Cuando un enfoque falla, un agente intenta con otro. OpenAI Codex hizo precisamente eso, obteniendo un instalador de Python del python.org real, comenzando con certutil. Eso fue bloqueado, por lo que cambió a bitsadmin. Ambas son utilidades legítimas de Windows de las que los atacantes abusan habitualmente para extraer cargas útiles y vivir de la tierra.

El objetivo era inofensivo, pero el punto de Sophos es que este comportamiento de pivote cuando se bloquea es lo que separa a un atacante vivo de un script estático, y ahora los agentes benignos también lo hacen.

Cursor activó una regla de persistencia al usar PowerShell para eliminar un script de carpeta de inicio que se ejecutaría cada vez que se iniciara la máquina. Sophos no pudo confirmar qué hacía el script, pero escribir en el inicio fuera de un instalador confiable es el tipo de cosas que los defensores señalan a la vista.

Agentes de IA en ambos lados de la línea

La otra cara ya es visible. Un mes antes, Sophos documentado un atacante que utilizó agentes de inteligencia artificial para crear y probar malware contra productos EDR, uno de ellos ejecutando Claude Opus 4.5 para coordinar el trabajo.

Ese era el momento del desarrollo: agentes que ayudaban a un atacante a escribir mejores herramientas. Los agentes también atacan a sus propios usuarios en tiempo de ejecución. En un caso separado, los investigadores demostraron que se podía engañar a un agente de codificación para que ejecutara código de atacante a través de entradas envenenadas, una cadena que puede pasar por alto EDR porque el agente actúa dentro de la sesión confiable del usuario.

Estos son eventos separados con diferentes reglas de activación, pero comparten una superficie: las llamadas de credenciales del navegador, las descargas de LOLBin y las escrituras de inicio ahora provienen de agentes benignos, agentes ejecutados por atacantes y agentes secuestrados.

Es por eso que la acción cruda te dice menos que antes. Y se encuentra dentro de un cambio mayor en la apariencia de las intrusiones. CrowdStrike’s Informe de amenazas globales 2026 descubrió que el 82 por ciento de las detecciones en 2025 estaban libres de malware, y los atacantes utilizaban credenciales válidas y herramientas confiables en lugar de descartar archivos.

Ciberseguridad

Ese cambio es lo que empujó la detección hacia el comportamiento en primer lugar. Los agentes de IA ahora generan el mismo comportamiento por razones ordinarias, abarrotando la señal exacta en la que los defensores llegaron a confiar.

Qué significa para los defensores

Si los desarrolladores ejecutan estos agentes con sus propias cuentas, es de esperar que se activen reglas de punto final en sus máquinas. La respuesta de Sophos es dividir las reglas según lo que captan. El ruido de ejecución de un agente que reintenta una descarga o emite PowerShell con un formato extraño generalmente puede tener un alcance.

Introduzca la regla en el proceso principal del agente (claude.exe, cursor.exe y sus procesos secundarios), su espacio de trabajo o ruta temporal, o la reputación del destino de descarga. Eso impide que un agente conocido que realiza un trabajo normal genere alertas.

El comportamiento que toca las credenciales es donde usted mantiene la línea. Descifrar las credenciales del navegador o enumerar el Administrador de credenciales no es seguro porque lo hizo un agente en lugar de una persona, y un agente no debe heredar el acceso general a los almacenes de credenciales solo porque se ejecuta bajo un usuario confiable. Si el ruido proviene del modo de omisión peligrosa de permisos de Claude Code, desactive ese modo a través de la configuración administrada.

Sophos llama a esto una lectura temprana, no un veredicto, y señala que el cambio aún es pequeño incluso si la dirección es clara. La cuestión de política abierta es qué se le debería permitir tocar a un agente de codificación en un punto final, y los almacenes de credenciales son un lugar sensato para trazar la primera línea.

El nuevo ataque HalluSquatting podría engañar a los asistentes de codificación de IA para que instalen malware Botnet – CYBERDEFENSA.MX

Los asistentes de codificación de IA tienen la costumbre de inventar cosas. Pídale a uno que busque una herramienta popular y, a veces, le devolverá un nombre que suena real para un proyecto que no existe.

Una nueva investigación, que sus autores denominan HalluEn cuclillasconvierte ese hábito en un ataque: descubra los nombres falsos que inventa una IA de manera confiable, regístrelos primero y espere a que el asistente busque su trampa en nombre del usuario.

Cualquiera cuyo asistente de IA pueda buscar un recurso externo y luego ejecutar comandos con poca revisión humana está expuesto. En las pruebas, esa ruta llevó al asistente a ejecutar código proporcionado por el atacante en la máquina.

Repítalo con un recurso bastante popular y un nombre colocado puede llegar a muchas máquinas, razón por la cual los investigadores lo plantean como una forma de montar una botnet.

como funciona

El ataque encadena dos peculiaridades de la IA. El primero es un alucinación: una IA que inventa algo y lo presenta como real. El segundo es un inyección inmediata: una instrucción trampa explosiva que secuestra la IA, por lo que sigue a un atacante en lugar del usuario.

Ciberseguridad

Aquí, la inyección es indirecta y se basa en el contenido que el asistente busca en lugar de cualquier cosa que el usuario escriba.

  1. Elige un objetivo. El atacante encuentra un repositorio o complemento que está de moda, por lo que muchas personas le piden a su IA que lo busque. Las tendencias importan, porque un recurso nuevo no está en los datos de entrenamiento de la IA, que es exactamente cuando el modelo comienza a adivinar los nombres.
  2. Aprende el error. El atacante le pide a una IA que busque ese recurso una y otra vez y registra el nombre falso que inventa con mayor frecuencia.
  3. Reclama el nombre falso. El atacante registra ese nombre en GitHub o en una tienda de complementos y oculta instrucciones adversas en su interior.
  4. Esperar. Un usuario real le pide a su asistente que obtenga el popular recurso. El asistente inventa el mismo nombre falso y en su lugar utiliza la versión del atacante. Sus instrucciones ocultas se combinan con lo que el asistente cree que le dijeron que hiciera, y el asistente secuestrado utiliza su propia herramienta de ejecución de comandos para llevarlas a cabo.

La trampa no es un código que se ejecuta por sí solo. Funciona porque estos asistentes mantienen una terminal entre sus herramientas integradas, por lo que una vez que las instrucciones establecidas se hacen cargo, «instalar un bot» es simplemente algo que el asistente puede hacer.

Lo que lo hace práctico es que los nombres falsos no son aleatorios. En los experimentos de los investigadores, el error fue consistente: en diferentes frases y en modelos de diferentes compañías, el asistente buscó el mismo nombre incorrecto en hasta el 85% de las solicitudes de repositorio y en el 100% de las instalaciones de habilidades. Esas son las tasas máximas que informan los autores; el periódico lleva el desglose completo.

Lo ejecutaron con herramientas como Cursor, Windsurf, GitHub Copilot, Cline, Gemini CLI de Google y la familia de asistentes OpenClaw, logrando que cada uno ejecutara código atacante. Las cargas útiles de prueba eran marcadores de posición inofensivos, no malware real; uno vivo tomaría el mismo camino.

El investigación proviene de Aya Spira y colegas del grupo de Ben Nassi en la Universidad de Tel Aviv, con Stav Cohen en Technion y Ron Bitton en Intuit. El grupo de Nassi ya ha hecho esto antes, creando un gusano de correo electrónico con IA que se propaga automáticamente y una invitación de calendario que secuestró Gemini de Google.

El equipo dice que informó a los proveedores, fabricantes de modelos y operadores del mercado afectados antes de salir a bolsa, y retuvo los pasos exactos necesarios para copiar el ataque.

¿Por qué es un nuevo tipo de botnet?

Las botnets tradicionales requieren trabajo para construirse. Se apoyan en contraseñas débiles o malware que se propaga de una máquina a otra, y generalmente agrupan un tipo de dispositivo, de la misma manera que Mirai agrupa cámaras y enrutadores.

Esto no necesita nada de eso. Sin contraseñas, sin gusanos, y debido a que la carga útil llega como texto que lee la IA en lugar de un exploit de red, no es el tipo de cosas que un firewall está atento. Las máquinas en las que aterriza pueden ejecutar cualquier sistema operativo, no una flota uniforme.

La IA es aquí la furgoneta de reparto, no la carga. Las instrucciones colocadas lo engañan para que instale un bot común y corriente, y una vez que ese bot se está ejecutando, la máquina pertenece a una botnet como cualquier otra. Lo nuevo es la combinación que lo lleva allí: un nombre que, como era de esperar, inventa una IA, un mercado donde cualquiera puede registrar ese nombre y un agente con permiso para buscar y ejecutar.

Las piezas no son nuevas, aunque la combinación sí lo sea. Los atacantes primero aprendieron a registrar nombres de paquetes de software falsos que inventan las IA, un truco llamado «slopsquatting».

En enero de 2026, Charlie Eriksen de Aikido Security encontró uno de esos paquetes npm inventados, reaccionar-codeshift, que las instrucciones escritas por IA ya se habían extendido a 237 proyectos de código, y los agentes todavía intentaban instalarlo diariamente; él lo registró él mismo antes de que cualquier atacante pudiera hacerlo, por lo que no causó daño.

Luego, la idea saltó de los paquetes a las direcciones web. La Unidad 42 de Palo Alto Networks descrita recientemente «en cuclillas fantasma» aproximadamente 250.000 dominios alucinados no registrados y libres para su uso (el artículo de THN está aquí).

Ciberseguridad

HalluSquatting es la versión que llega hasta la ejecución del código secuestrando al agente que realiza la búsqueda. Y los mercados destinados a detectar cargas incorrectas no son un gran respaldo: en junio, Trail of Bits pasó sus «habilidades» maliciosas por los escáneres de varias tiendas en menos de una hora.

que hacer

Todo depende de una condición: un agente que busca un recurso externo y lo ejecuta sin que nadie lo controle. Ciérralo y el ataque se detendrá. La solución más eficaz es también la más sencilla: hacer que el asistente busque antes de buscar.

Una búsqueda real fundamenta al agente en lo que realmente existe y elimina drásticamente las conjeturas. Ese es un trabajo para las personas que crean estas herramientas, quienes también pueden capacitar al planificador (la parte que asigna una solicitud a los pasos) para buscar un recurso primero y tratar palabras como clonar, instalar y recuperar como indicadores.

Los usuarios y los equipos de seguridad tienen palancas a corto plazo. De forma predeterminada, estos agentes preguntan antes de ejecutar un comando. La exposición son los modos de ejecución automática (el indicador de omisión de permisos de Claude Code, el modo yolo de Gemini CLI) que lo desactivan, por lo que la primera regla es no permitir que un agente ejecute sin supervisión nada de lo que haya recuperado.

Algunas herramientas ahora agregan una capa de seguridad que inspecciona lo que el agente lee o está a punto de hacer antes de actuar, como el modo automático de Claude Code y la verificación Conseca de Gemini CLI, pero eso reduce el riesgo en lugar de eliminarlo. Ningún interruptor cierra esto, así que verifique también que el nombre de un repositorio o paquete se resuelva en la fuente real esperada antes de que un agente lo ingrese, y trate cualquier nombre que le entregue una IA como una suposición, no como un hecho.

Las plataformas tienen su propia palanca. Pueden dejar de permitir que las personas reutilicen nombres de repositorios conocidos en cuentas nuevas y preregistrar los nombres falsos que probablemente inventen las IA (la misma defensa que ya se usa contra la typosquatting), para que esos nombres apunten al proyecto real.

Los investigadores llaman a sus resultados un límite inferior: «Los ataques siempre mejoran; nunca empeoran». No hay ningún CVE único para parchear aquí. No lo plantean como un error de un producto, sino como una debilidad en la forma en que los agentes de IA confían en nombres que en realidad nunca les dieron.

GuardFall expone agentes de codificación de IA de código abierto a riesgos de inyección de shell de décadas de antigüedad – CYBERDEFENSA.MX

El control de seguridad que se supone debe impedir que un agente de codificación de IA ejecute un comando peligroso se puede pasar directamente utilizando un truco de shell que ha sido público durante décadas.

Nueva investigación de IA adversaque se denomina bypass caída de guardiadescubrió que funciona contra diez de los once agentes populares de codificación y uso de computadoras de código abierto que la empresa probó. Sólo uno, «Continuar», fue construido para defenderse de ello.

¿Por qué importa? Estos agentes ejecutan comandos de shell con acceso completo a su cuenta. Apunte uno a un repositorio o paquete de software con trampa explosiva, y una instrucción oculta puede ejecutar silenciosamente un comando que borra archivos o roba los secretos a los que puede acceder su cuenta, desde claves SSH y credenciales de la nube hasta cualquier cosa que se encuentre en su carpeta de inicio.

¿Cómo pasa la guardia?

La mayoría de estos agentes intentan mantenerse seguros comparando cada comando con una lista de bloqueo de patrones peligrosos antes de ejecutarlo. El defecto es que verifican el comando como texto sin formato, mientras que bash reescribe ese texto antes de ejecutarlo. El shell elimina las comillas y expande los atajos, por lo que el filtro y el shell terminan mirando dos cosas diferentes.

El ejemplo más sencillo: un filtro que vigila habitación no ve nada malo en r»m, porque para un comparador de texto esas son cadenas diferentes. Bash elimina las comillas vacías y ejecuta rm de todos modos.

Ciberseguridad

La misma idea funciona en otras formas: un comando oculto en base64 y canalizado a un shell, o herramientas ordinarias como find y dd se vuelven destructivas con la bandera correcta.

Los investigadores no llaman a esto un error sino «una convención peligrosa y una clase de problemas», razón por la cual agregar más patrones de lista de bloqueo no soluciona nada de esto. No existe un único CVE para rastrear o parchar.

Dos cosas tienen que alinearse para que un ataque aterrice, y ninguna es exótica.

  • Primero, la IA tiene que producir el comando malicioso. Generalmente se rechaza un contundente «ejecutar rm -rf», pero el mismo comando escondido dentro de un trabajo de apariencia normal, como un archivo de compilación o la respuesta de «documentación» de una herramienta, se emite como un paso de rutina.
  • En segundo lugar, el agente debe ejecutarse por sí solo, con un indicador de ejecución automática activado o su entorno de pruebas de contenedor desactivado, los cuales son rutinarios en las canalizaciones automatizadas. Las pruebas en vivo utilizaron Claude Sonnet 4.6.

Las otras diez herramientas dejaron la brecha abierta: opencode, Goose, Cline, Roo-Code, Aider, Plandex, Open Interpreter, OpenHands, SWE-agent y el proyecto Hermes, donde surgió el error por primera vez y ahora documentado en el propio rastreador de problemas de Hermes.

Las herramientas de la encuesta de Adversa tenían en conjunto aproximadamente 548.000 estrellas de GitHub en mayo de 2026. Adversa demostró el ataque completo de extremo a extremo contra el binario de producción Plandex, y la misma forma funcionó contra otros ocho. Describe el trabajo como investigación de laboratorio; no se ha informado de explotación pública.

Continúe, el único agente que se resiste, se defiende leyendo el comando como lo hará bash antes de decidir: divide el comando en las mismas partes que lo haría el shell, verifica lo que realmente se ejecuta y mantiene una lista estricta de comandos destructivos que están bloqueados por completo.

Ciberseguridad

Esa protección se mantuvo contra cada carga útil en el modo de editor predeterminado de Continuar. Su modo de ejecución automática de línea de comandos es más débil: algunas cargas útiles se escaparon, aunque las más destructivas aún alcanzaron el bloque duro. Adversa considera que el diseño es portátil y dice que volver a implementarlo requiere aproximadamente un trabajo de dos días para un ingeniero experimentado.

Que hacer ahora

Ninguna de las soluciones rápidas es una respuesta completa, pero reducen su exposición hasta que se implemente la protección adecuada:

  • Ejecute agentes con $HOME apuntando a una carpeta desechable, de modo que secretos como ~/.ssh y ~/.aws estén fuera de su alcance.
  • Desactive los indicadores de ejecución automática como –auto-exec, –auto-run, –auto-test y permisos de omisión peligrosa a menos que el trabajo realmente no pueda pausarse para un humano.
  • No permita que los agentes ejecuten solicitudes de extracción desde bifurcaciones, el camino fácil desde el archivo de un atacante hasta sus secretos.
  • Trate los archivos de configuración enviados dentro de un repositorio, como .aider.conf.yml, como código que no es de confianza; uno malicioso puede desencadenar el ataque en la primera edición aceptada.

GuardFall aterriza en medio de una serie de hallazgos similares este año. El propio adversario ConfianzaCaída presione Claude Code, Cursor, Gemini CLI y Copilot CLI, y un separado omisión de regla de denegación Pulsa Claude Code.

Ataques como AutoJack y Agentjacking convirtieron contenido envenenado en comandos que un agente ejecuta con los privilegios de su propietario. El hilo común es simple: el texto que no es de confianza sigue llegando a un shell real antes de que el guardia entienda qué se ejecutará realmente bash.