Las pruebas de codificación falsas generan malware alineado con OtterCookie oculto en imágenes de banderas SVG – CYBERDEFENSA.MX

Se ha observado que los actores de amenazas norcoreanos vinculados a la campaña Contagious Interview emplean esteganografía en archivos de imágenes SVG para ocultar cargas útiles maliciosas como parte de una campaña que utiliza ofertas de trabajo falsas y desafíos de codificación.

«Cualquier usuario que ejecutara el proyecto terminó con una carga útil de cuatro etapas alineada con OTTERCOOKIE: un ladrón de credenciales de navegador y billeteras criptográficas, un ladrón de archivos, un troyano de acceso remoto (RAT) basado en Socket.IO y un ladrón de portapapeles», Elastic Security Labs dicho en un informe compartido con The Hacker News.

Los hallazgos resaltan una vez más el continuo ataque a los desarrolladores de software por parte de piratas informáticos patrocinados por el Estado alineados con la República Popular Democrática de Corea (RPDC) con el objetivo de robar datos confidenciales y saquear carteras de criptomonedas. La actividad está siendo rastreada bajo el nombre de REF9403.

El brazo de ciberseguridad de la plataforma holandesa de búsqueda y observabilidad empresarial dijo que descubrió la campaña después de que los actores de amenazas atacaran a miembros de su espacio de trabajo comunitario de Slack con señuelos de ingeniería social para supuestas ofertas de trabajo, destacando una nueva vía de acceso inicial no documentada previamente en ataques asociados con Contagious Interview, una sofisticada operación de ingeniería social en curso desde al menos diciembre de 2022.

Los mensajes, publicados por un usuario llamado Maxwell en el canal #jobs Slack a finales de mayo de 2026, buscaban un desarrollador experimentado para ayudar a actualizar su plataforma de comercio electrónico a una «arquitectura moderna y escalable que utiliza Next.js (v14), NestJS, PostgreSQL y Auth.js» junto con la integración de Stripe.

Ciberseguridad

Aquellos que expresaron interés en la oportunidad recibieron mensajes directos que les indicaban que completaran una evaluación de codificación como parte de la oferta de trabajo, una táctica estándar observada en las campañas de entrevistas contagiosas. La tarea implicó ejecutar un repositorio troyanizado que contenía malware diseñado para filtrar datos valiosos y configurar una puerta trasera Socket.IO.

Específicamente, los repositorios distribuidos como parte del esquema incorporan código completamente funcional pero también incorporan código malicioso en forma de imágenes SVG para evitar la detección.

«Si bien estos proyectos aparentemente legítimos funcionan perfectamente bien, el código malicioso se activa silenciosamente detrás de escena», dijo Elastic. «Las cargas útiles se dividen en fragmentos base64 dentro de comentarios HTML en cada imagen de bandera SVG dentro de un directorio de activos. Estos archivos parecen ser imágenes normales de banderas de países (AE.svg, AF.svg), pero cada archivo contiene un bloque de comentarios inyectado con datos codificados en Base64».

Luego, la carga útil se ensambla mediante un archivo JavaScript («serverValidation.js») presente en el repositorio. La cadena de ataque está diseñada de tal manera que el malware se ejecuta en cada inicio del servidor. Elastic dijo que las principales cargas útiles se superponen con OtterCookie, un malware multiplataforma que surgió por primera vez en septiembre de 2024.

OtterCookie «evolucionó de una herramienta básica para ejecutar comandos remotos y buscar claves criptográficas a un programa modular capaz de realizar un robo de datos más amplio con capacidad para verificar entornos de VM, instalar clientes de comunicación como socket.io para C2, filtrar información, ejecutar comandos de shell arbitrarios, cargar otros módulos para recopilar datos específicos e informar los resultados», Microsoft anotado allá por marzo.

Ciberseguridad

El malware incorpora cuatro módulos distintos que le permiten recopilar datos de navegadores web y carteras de criptomonedas, recopilar archivos que coincidan con una lista específica de extensiones, facilitar el control remoto persistente utilizando un troyano basado en Socket.IO que puede ejecutar comandos de shell, capturar contenido del portapapeles y soltar ejecutables de Windows.

Entre los archivos recopilados por OtterCookie se incluyen extensiones de herramientas de codificación de inteligencia artificial (IA) como .claude, .cursor, .gemini, .windsurf, .pearai y .llama, lo que sugiere que el actor de amenazas está refinando activamente su arsenal para aspirar la mayor cantidad de información posible.

Vale la pena señalar que el malware también muestra algunas superposiciones funcionales con un ladrón de datos y un troyano distribuido a través de paquetes npm falsos disfrazados de herramientas Rollup polyfill, lo que sugiere que los actores de la amenaza están buscando múltiples vectores de propagación.

«Esta campaña refuerza el hecho de que los desarrolladores siguen siendo un objetivo principal, donde el compromiso de un solo individuo puede proporcionar el acceso inicial necesario para permitir ataques de gran alcance a la cadena de suministro contra organizaciones posteriores», dijo Elastic. «El éxito de estas operaciones subraya cómo comprometer a un desarrollador individual puede proporcionar un camino hacia un impacto organizacional mucho más amplio».

GPT-Red de OpenAI automatiza las pruebas de inyección rápidas para endurecer el sol GPT-5.6 – CYBERDEFENSA.MX

OpenAI ha revelado detalles de GPT-Rojoun modelo interno automatizado de equipo rojo que escala el descubrimiento rápido de vulnerabilidades de inyección con el objetivo de solucionar problemas antes de que las herramientas se implementen ampliamente.

«GPT-Red es un equipo rojo fuerte y nuestros modelos anteriores son muy vulnerables a sus rápidos ataques de inyección», la empresa de inteligencia artificial (IA) dicho. «Utilizamos GPT-Red para entrenar adversariamente a GPT-5.6, haciéndolo mucho más robusto para provocar inyecciones».

El modelo funciona igual que un miembro del equipo rojo humano. Envía un mensaje, monitorea cómo responde un modelo GPT y recorre su camino hacia un objetivo malicioso, como cargar datos confidenciales a un servidor externo.

Este avance se produce cuando las inyecciones rápidas adversas siguen siendo una espina persistente en la carne de los grandes modelos de lenguaje, a los que se puede engañar para que ejecuten una instrucción cuidadosamente elaborada⁠ que puede producir consecuencias indeseables.

A medida que los sistemas agentes continúan vinculados a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo al incorporar mensajes maliciosos dentro de contenido aparentemente inofensivo que se alimenta como entrada. Esto puede tomar la forma de un correo electrónico, una página web, una respuesta de herramienta o un repositorio de código.

Ciberseguridad

GPT-Red tiene como objetivo aumentar el equipo rojo humano a escala, haciendo posible identificar nuevos modos de falla, mejorar la solidez y construir contramedidas adecuadas antes de que se puedan implementar los modelos.

«De manera similar a cómo los miembros del equipo rojo humano elaboran ataques, el modelo trabaja hacia un objetivo enviando un mensaje, observando cómo responden los modelos GPT e iterando», dijo OpenAI.

Al integrar directamente GPT-Red en el proceso de capacitación de sus modelos de producción, OpenAI dijo que GPT-5.6 Sol es su modelo más robusto para inyecciones inmediatas hasta la fecha, logrando 6 veces menos fallas en comparación con el punto de referencia de inyección directa directa en comparación con GPT-5.5, su modelo de frontera de cuatro meses antes.

Algunos de los ejemplos de conversaciones inyectadas con indicaciones probadas como parte del proceso incluyen:

  • Exfiltración de directorio interno
  • Instrucciones de pago fraudulentas
  • Exfiltración de credenciales de Amazon Web Services (AWS)
  • Deshabilitar la autenticación de dos factores (2FA)
  • Carga del archivo de credenciales
  • Inyección de script externo
  • Reenvío de claves API
  • Scripts de raspado maliciosos

«GPT-Red se entrena mediante el aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de equipos rojos», explicó OpenAI. «GPT-Red es recompensado por provocar un fallo válido, como una inyección rápida exitosa, mientras que los modelos defensores son recompensados ​​por resistir el ataque y completar sus tareas originales».

Esto también significa que a medida que los modelos defensores se vuelvan más robustos, el modelo de equipo rojo tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas barreras. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT-5.1 en más escenarios que los equipos rojos humanos cuando se trata de inyecciones rápidas indirectas.

OpenAI además destacó que GPT-Red se mantiene separado de los otros modelos para que las capacidades maliciosas incorporadas no lleguen a los malos actores que buscan constantemente varias formas de eludir las medidas éticas y de seguridad de un modelo.

En una prueba del mundo real, OpenAI apuntó GPT-Red a una máquina expendedora basada en IA construida por Andon Labs. Después de practicar en simulación, el modelo apuntó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 dólares, pedir un nuevo artículo de 100 dólares por esa misma cantidad y cancelar el pedido de otro cliente. Tras una divulgación responsable, se están probando nuevas salvaguardias, añadió.

Ciberseguridad

Un segundo estudio de caso involucró el uso de GPT-Red para atacar a un agente de línea de comandos del Codex, basado en GPT-5.4 mini, en 10 tareas de exfiltración de datos retenidas, lo que provocó que se transmitieran datos confidenciales en más casos que una línea de base solicitada por GPT-5.5.

Una versión inicial del modelo también ha descubierto una nueva clase de ataques de inyección rápida directa conocidos como ataques de cadena de pensamiento (CoT) falsos, que lograron tasas de éxito superiores al 95 % en GPT-5.1, pero ahora están por debajo del 10 % para GPT-5.6 Sol.

«De manera similar, varios de nuestros puntos de referencia de inyección rápida indirecta que apuntan a ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)», dijo OpenAI.

«La robustez del propio GPT-Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de los ataques de GPT-Red han disminuido monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT-5.6 Sol falla en solo el 0,05% de las inyecciones directas de GPT-Red».

La divulgación se produce cuando la empresa dicho una auditoría de SWE-Bench Pro encontró que alrededor del 30% de las tareas están rotas, retractándose de su recomendación anterior de adoptar la punto de referencia para medir las capacidades de codificación de fronteras. A principios de febrero, OpenAI dicho se estaba alejando de SWE-bench Verificado debido a problemas fundamentales de diseño y contaminación.

«Encontramos evidencia de problemas críticos en una parte significativa del conjunto de datos», dijo OpenAI. «Nuestro proceso de análisis de puntos de datos detectó 200 (27,4%) tareas fallidas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de puntos de referencia que sean difíciles de jugar, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo».

La vulnerabilidad en el administrador de agentes Antigravity AI de Google podría escapar de la zona de pruebas y permitir a los atacantes la ejecución remota de código

A medida que las organizaciones consideran la IA agente para sus negocios y sus pilas de TI, los investigadores continúan encontrando errores y vulnerabilidades en los principales modelos comerciales que pueden expandir significativamente su superficie de ataque.

Esta semana, investigadores de Pillar Security revelado una vulnerabilidad en Antigravity, una herramienta de desarrollo impulsada por IA para operaciones de sistemas de archivos creada por Google.

El error, parcheado desde entonces, combinaba la inyección rápida con la capacidad permitida de creación de archivos de Antigravity para otorgar a los atacantes privilegios de ejecución remota de código.

La investigación detalla cómo el exploit pudo eludir el modo seguro de Antigravity, la configuración de seguridad más alta de Google para sus agentes que ejecuta todas las operaciones de comando a través de un entorno de pruebas virtual, acelera el acceso a la red y prohíbe al agente escribir código fuera del directorio de trabajo.

Se supone que el modo seguro limita el acceso del agente de IA a sistemas sensibles y su capacidad para ejecutar actos maliciosos o peligrosos a través de comandos de shell. Pero una de las herramientas de búsqueda de archivos utilizadas por Antigravity, llamada «find_by_name», está clasificada como una herramienta del sistema «nativa». Esto significa que el agente puede ejecutarlo directamente y antes de que protecciones como el Modo seguro puedan incluso evaluar las operaciones a nivel de comando.

«El límite de seguridad que impone el Modo Seguro simplemente nunca ve esta llamada», escribió Dan Lisichkin, investigador de seguridad de IA de Pillar Security. «Esto significa que un atacante logra la ejecución de código arbitrario bajo la configuración exacta en la que confiaría un usuario preocupado por la seguridad para evitarlo».

Los ataques de inyección rápida se pueden realizar a través de cuentas de identidad comprometidas conectadas al agente, o indirectamente ocultando instrucciones clandestinas dentro de archivos de código abierto o contenido web que el agente ingiere. Antigravity tiene problemas para distinguir entre los datos escritos que ingiere para el contexto y las instrucciones literales, por lo que se puede lograr un compromiso sin ningún acceso elevado al hacer que lea un documento o archivo malicioso.

Según un cronograma de divulgación proporcionado por Pillar Security, el error se informó a Google el 6 de enero y se corrigió el 28 de febrero, y Google otorgó una recompensa por el descubrimiento.

Lisichkin dijo que este mismo patrón de inyección rápida a través de entradas no validadas se ha encontrado en otros agentes de codificación de IA como Cursor. En la era de la IA, cualquier entrada no validada puede convertirse en un mensaje malicioso capaz de secuestrar sistemas internos.

«El modelo de confianza que sustenta los supuestos de seguridad, de que un humano detectará algo sospechoso, no se sostiene cuando agentes autónomos siguen instrucciones de contenido externo», escribió.

El hecho de que la vulnerabilidad haya podido eludir por completo el modo seguro de Google subraya cómo la industria de la ciberseguridad debe comenzar a adaptarse y «ir más allá de los controles basados ​​en la desinfección».

«Cada parámetro de herramienta nativa que llega a un comando de shell es un punto de inyección potencial. La auditoría de esta clase de vulnerabilidad ya no es opcional y es un requisito previo para enviar funciones agentes de forma segura», escribió Lisichkin.

Derek B. Johnson

Escrito por Derek B. Johnson

Derek B. Johnson es reportero de CyberScoop, donde su área incluye la ciberseguridad, las elecciones y el gobierno federal. Antes de eso, ha brindado una cobertura galardonada de noticias sobre ciberseguridad en los sectores público y privado para varias publicaciones desde 2017. Derek tiene una licenciatura en periodismo impreso de la Universidad de Hofstra en Nueva York y una maestría en políticas públicas de la Universidad George Mason en Virginia.