Defectos críticos del cursor podrían permitir que la inyección rápida escape del sandbox y ejecute comandos – CYBERDEFENSA.MX

Dos fallas en Cursor, un editor de código de IA, podrían permitir que un único mensaje de apariencia ordinaria salga del entorno de pruebas de seguridad del editor y ejecute cualquier comando en la computadora de un desarrollador. No hay ningún clic del que enamorarse ni ningún cuadro de aprobación que ignorar.

Cato AI Labs encontró la pareja y les puso nombre tobogán de dunas. Se les rastrea como CVE-2026-50548 y CVE-2026-50549, ambos con una calificación de 9,8 sobre 10 (o 9,3 según la escala CVSS 4.0 más nueva).

La solución ya está disponible. Ambos errores se corrigen en Cursor 3.0, lanzado el 2 de abril, y todas las versiones anteriores a la 3.0 se ven afectadas. El creador de Cursor dice que más de la mitad de las empresas Fortune 500 usan la herramienta, así que si la ejecutas, actualízala ahora.

Para qué servía el arenero y cómo se rompió

A partir de la línea 2.x, Cursor ejecuta los comandos de terminal que su agente de IA emite dentro de una caja de arena de forma predeterminada: una caja cerrada que limita lo que esos comandos pueden tocar, por lo que una instrucción perdida no puede arruinar la máquina.

DuneSlide se trata de salir de esa caja. La forma de entrar es la inyección inmediata. El atacante nunca escribe en su cursor. Colocan instrucciones dentro de algo que su agente lee en su nombre, como un servicio conectado a través del Protocolo de contexto modelo (MCP) o una página devuelta por una búsqueda web.

Ciberseguridad

Usted hace una pregunta normal, las instrucciones ocultas aparecen durante el proceso y, como no necesita clic ni aprobación de su parte, el ataque es de «clic cero».

Ambas fallas usan el mismo truco: hacer que el agente escriba un archivo que no se le debe permitir escribir y luego usar esa escritura para desactivar la zona de pruebas.

  • CVE-2026-50548 Abusa de un entorno. El sandbox permite escrituras en la carpeta de trabajo de un comando, y esa carpeta es un parámetro opcional, directorio_de_trabajo, en la herramienta run_terminal_cmd de Cursor. Cuando el agente lo configura en una ruta no predeterminada, Cursor agrega esa ruta a la lista de escritura permitida sin lugar a dudas. Las instrucciones inyectadas apuntan a un archivo del sistema en lugar del proyecto. Sobrescriba el asistente de sandbox (en macOS, /Applications/Cursor.app/Contents/Resources/app/resources/helpers/cursorsandbox) y los comandos posteriores se ejecutarán sin ningún sandbox. Los archivos de inicio como ~/.zshrc también funcionan como objetivos.
  • CVE-2026-50549 abusa del control de seguridad. Antes de escribir, Cursor resuelve accesos directos (enlaces simbólicos) para confirmar que el destino real se encuentra dentro de su proyecto. El error es la alternativa: cuando esa verificación falla, porque el objetivo no existe o el atacante elimina el acceso de lectura de una carpeta en la ruta, Cursor se da por vencido y confía en la ruta del acceso directo dentro del proyecto. Un atacante crea un acceso directo que apunta fuera del proyecto, fuerza que la verificación falle y Cursor escribe directamente en el mismo asistente de sandbox. Mismo escape, diferente puerta.

Una vez que se neutraliza la zona de pruebas, el siguiente comando se ejecuta como usted. Eso significa control de la máquina del desarrollador, además de cualquier espacio de trabajo en la nube o SaaS en el que el editor haya iniciado sesión. Todo se deriva de un mensaje aparentemente inofensivo.

No hay señales de que esto haya sido utilizado en ataques reales. Cato lo presenta como una investigación, no como una campaña activa, y el registro público de vulnerabilidad no muestra ninguna explotación conocida en el momento de su publicación.

Cato informó ambos problemas el 19 de febrero. Según el relato de Cato, Cursor los rechazó cuatro días después, diciendo que su modelo de amenaza no cubría el uso indebido de los servidores MCP, ni siquiera los estándar como el espacio de trabajo oficial de Linear.

Catón se intensificó el 26 de febrero; Cursor reabrió los informes, los clasificó y envió ambas correcciones en 3.0. Los ID CVE se asignaron el 5 de junio.

Ciberseguridad

Cursor publicó el suyo consultivo para el error del enlace simbólico, y su registro NVD está en vivo.

No es el primero, y probablemente tampoco el último.

DuneSlide es el último de una serie de errores de cursor que comienzan con un mensaje envenenado y terminan con la ejecución de código, cada uno de los cuales supera una barrera de seguridad diferente. The Hacker News cubrió las rondas anteriores:

  • CurXecute (CVE-2025-54135, agosto de 2025) provenía del mismo equipo y entonces operaba como Aim Security. Un mensaje de Slack colocado reescribió la configuración ~/.cursor/mcp.json de Cursor y ejecutó comandos incluso después de que el usuario rechazó la edición. Corregido en 1.3.
  • MCPoison (CVE-2025-54136), de Check Point Research, permite a un atacante obtener una configuración de MCP aprobada una vez y luego intercambiar silenciosamente comandos maliciosos sin un segundo mensaje.
  • CVE-2026-26268 (febrero de 2026) escondió un gancho de Git con trampa explosiva en un repositorio que se activó en el momento en que el agente ejecutó un comando de Git. Parcheado en 2.5.

La zona de pruebas en la línea 2.x fue la respuesta de Cursor a esa ola anterior. DuneSlide se trata de escapar de la respuesta.

Cato dice que está revelando fallas similares en otros agentes de codificación y argumenta que el problema es estructural y no una serie de hechos puntuales.

Eso deja una pregunta abierta para cualquiera que envíe un agente que lea la web abierta: si tratar cada entrada como hostil se convierte en la opción predeterminada o sigue siendo una lucha parche por parche.

El nuevo malware Gaslight macOS utiliza la inyección rápida para interrumpir el análisis asistido por IA – CYBERDEFENSA.MX

Se ha descubierto que un implante de macOS basado en Rust y un ladrón de información previamente indocumentados incorpora una carga útil de inyección rápida diseñada para engañar a las herramientas de inteligencia artificial (IA) de un analista de malware y engañarlo para que aborte o rechace un análisis del artefacto.

El malware tiene un nombre en código. luz de gas debido a este comportamiento engañoso. Se ha evaluado con gran confianza que la herramienta es obra de actores de amenazas alineados con Corea del Norte.

«Su característica más notable es una cascada incorporada de mensajes inventados sobre fallas del sistema, diseñada para hacer que un agente de clasificación asistido por LLM dude de su propia sesión», dijo el investigador de SentinelOne, Phil Stokes. dicho en un informe técnico. «Ataca la percepción del agente, en lugar del entorno de pruebas en el que se encuentra».

Un elemento central de la arquitectura del malware es un canal de comando y control (C2) basado en API del bot de Telegram que ingresa en un ciclo de sondeo, lo que permite al operador emitir instrucciones a través de un shell interactivo y devolver los resultados de la ejecución. En el caso de que dos instancias del mismo token de bot sondeen simultáneamente, se emite una respuesta de «Conflicto», lo que provoca que finalice la segunda copia.

Ciberseguridad

El shell admite seis comandos principales, lo que garantiza un punto de apoyo persistente sobre el host infectado:

  • ayuda, para mostrar ayuda de comando
  • id, para identificar el implante al operador
  • shell, para ejecutar un comando de shell a través de vicepresidente ejecutivo
  • matar, para terminar un proceso objetivo mediante PID
  • subir, para extraer un archivo a través del mecanismo «attach://» de Telegram
  • stop, para detener la ejecución del implante

SentinelOne dijo que identificó señales que sugieren la presencia de un séptimo comando llamado «enfoque», aunque su funcionalidad sigue siendo indeterminada en este momento. Para lograr persistencia, Gaslight hace uso de un Agente de lanzamiento que utiliza la etiqueta «com.apple.system.services.activity» en su archivo .plist.

También está integrado en el malware un script Python codificado en Base64 de 6,6 KB que funciona como un conjunto de recopilación de información responsable de recopilar historiales de comandos de Terminal, listados de aplicaciones instaladas, instantáneas de procesos en ejecución, hardware del sistema y perfil de software. Base de datos de llaveros de macOSy datos de los navegadores web Chrome, Brave, Firefox y Safari. Posteriormente, los datos recopilados se comprimen en un archivo ZIP («temp/collected_data.zip») y se cargan a través de Telegram.

El ladrón de Python, por su parte, se implementa mediante un instalador bash separado de 2 KB codificado en Base64 que elimina un intérprete cpython-3.10.18 del proyecto «astral-sh/python-build-standalone». La presencia de emojis y encabezados de comentarios extensos indica que probablemente se generó utilizando un modelo de lenguaje grande (LLM).

Ciberseguridad

Lo notable de Gaslight es que los detalles relacionados con el token del bot, el ID del chat (tg_room_id) y el resto de la configuración del operador no están codificados en la muestra, sino que se proporcionan en tiempo de ejecución. «El implante redacta automáticamente su token de bot de Telegram en su propia salida de tiempo de ejecución, negándolo a cualquiera que capture registros o bloquee artefactos», agregó Stokes.

Además de eso, el malware intenta evadir una detección basada en IA incorporando un bloque delimitado por Markdown que contiene 38 mensajes de «sistema» fabricados y diseñados para engañar a un agente de seguridad para que aborte, trunque o rechace el análisis.

«El andamio contiene mensajes falsos del sistema sobre caducidad de tokens, muertes por falta de memoria, agotamiento del disco y fallas repetidas en las operaciones. También plantea advertencias falsas sobre vulnerabilidades de inyección y indicadores de análisis estático», dijo SentinelOne, calificándolo de un «intento de convertir en arma los canales de clasificación asistidos por LLM que se encuentran cada vez más en el ciclo de ingeniería inversa».

Google parchea un fallo del IDE antigravedad que permite la rápida ejecución del código de inyección – CYBERDEFENSA.MX

Investigadores de ciberseguridad han descubierto una vulnerabilidad en el entorno de desarrollo integrado (IDE) agente de Google, Antigravity, que podría explotarse para lograr la ejecución de código.

La falla, ya parcheada, combina las capacidades permitidas de creación de archivos de Antigravity con una desinfección de entrada insuficiente en la herramienta de búsqueda de archivos nativa de Antigravity, find_by_name, para evitar las fallas del programa. Modo estrictouna configuración de seguridad restrictiva que limita el acceso a la red, evita escrituras fuera del espacio de trabajo y garantiza que todos los comandos se ejecuten dentro de un contexto de la zona de pruebas.

«Al inyectar el indicador -X (exec-batch) a través del parámetro Patrón [in the find_by_name tool]un atacante puede obligar a fd a ejecutar binarios arbitrarios en archivos del espacio de trabajo», dijo Dan Lisichkin, investigador de Pillar Security. dicho en un análisis.

«Combinado con la capacidad de Antigravity para crear archivos como una acción permitida, esto permite una cadena de ataque completa: preparar un script malicioso y luego activarlo a través de una búsqueda aparentemente legítima, todo sin interacción adicional del usuario una vez que llega la inyección».

El ataque aprovecha el hecho de que la llamada a la herramienta find_by_name se ejecuta antes de que se aplique cualquiera de las restricciones asociadas con el modo estricto y, en cambio, se interpreta como una invocación de herramienta nativa, lo que lleva a la ejecución de código arbitrario. Si bien el parámetro Pattern está diseñado para aceptar un patrón de búsqueda de nombre de archivo para activar una búsqueda de archivos y directorios usando fd hasta find_by_name, se ve socavado por una falta de validación estricta, pasando la entrada directamente al comando fd subyacente.

Por lo tanto, un atacante podría aprovechar este comportamiento para preparar un archivo malicioso e inyectar comandos maliciosos en el parámetro Pattern para desencadenar la ejecución de la carga útil.

«El indicador crítico aquí es -X (exec-batch). Cuando se pasa a fd, este indicador ejecuta un binario específico en cada archivo coincidente», explicó Pillar. «Al crear un valor de patrón de -Xsh, un atacante hace que fd pase archivos coincidentes a sh para su ejecución como scripts de shell».

Ciberseguridad

Alternativamente, el ataque se puede iniciar mediante una inyección indirecta sin tener que comprometer la cuenta de un usuario. En este enfoque, un usuario desprevenido extrae un archivo aparentemente inofensivo de una fuente no confiable que contiene comentarios ocultos controlados por el atacante que instruyen al agente de inteligencia artificial (IA) a preparar y activar el exploit.

Tras la divulgación responsable el 7 de enero de 2026, Google abordó la deficiencia a partir del 28 de febrero.

«Las herramientas diseñadas para operaciones restringidas se convierten en vectores de ataque cuando sus entradas no están estrictamente validadas», dijo Lisichkin. «El modelo de confianza que sustenta las suposiciones de seguridad, de que un humano detectará algo sospechoso, no se sostiene cuando agentes autónomos siguen instrucciones de contenido externo».

Los hallazgos coinciden con el descubrimiento de una serie de fallas de seguridad ahora parcheadas en varias herramientas impulsadas por IA:

  • Se ha descubierto que Anthropic Claude Code Security Review, Google Gemini CLI Action y GitHub Copilot Agent son vulnerables a la inyección rápida a través de comentarios de GitHub, lo que permite a un atacante convertir títulos de solicitudes de extracción (PR), cuerpos de problemas y comentarios de problemas en vectores de ataque para el robo de claves API y tokens. El ataque de inyección rápida ha recibido el nombre en clave Comentar y controlarya que convierte en arma el ataque de un agente de IA. acceso elevado y su capacidad para procesar entradas de usuarios que no son de confianza para ejecutar instrucciones maliciosas.
  • «El patrón probablemente se aplica a cualquier agente de IA que ingiere datos de GitHub que no son de confianza y tiene acceso a herramientas de ejecución en el mismo tiempo de ejecución que los secretos de producción, y más allá de GitHub Actions, a cualquier agente que procesa entradas que no son de confianza con acceso a herramientas y secretos: bots de Slack, agentes de Jira, agentes de correo electrónico, automatización de implementación», dijo el investigador de seguridad Aonan Guan. «La superficie de inyección cambia, pero el patrón es el mismo».
  • Otra vulnerabilidad en Claude Code, descubierto por ciscoes capaz de envenenar la memoria del agente de codificación y mantener la persistencia en cada proyecto y cada sesión, incluso después de reiniciar el sistema. El ataque esencialmente utiliza un ataque a la cadena de suministro de software como vector de acceso inicial para lanzar una carga útil maliciosa que puede alterar los archivos de memoria del modelo con fines maliciosos (por ejemplo, enmarcar prácticas inseguras como requisitos arquitectónicos necesarios) y agrega un alias de shell a la configuración de shell del usuario.
  • Se ha descubierto que el editor de código de IA Cursor es susceptible a una cadena de vulnerabilidad crítica de vida de la tierra (LotL) denominada NomShub eso hace posible que un repositorio malicioso secuestre clandestinamente la máquina de un desarrollador aprovechando una combinación de inyección indirecta, un escape de sandbox del analizador de comandos a través de componentes integrados del shell como export y cd, y el túnel remoto integrado de Cursor, otorgando al atacante acceso persistente y no detectado al shell simplemente al abrir el repositorio en el IDE.
  • Una vez que se obtiene el acceso persistente, el atacante puede conectarse a la máquina sin activar nuevamente la inyección rápida ni generar alertas de seguridad. Debido a que Cursor es un binario legítimo firmado y certificado ante notario, el adversario tiene acceso ilimitado al host subyacente, obteniendo acceso completo al sistema de archivos y capacidades de ejecución de comandos.
  • «Un atacante humano necesitaría encadenar múltiples exploits y mantener un acceso persistente», dijeron los investigadores de Straiker, Karpagarajan Vikkii y Amanda Rousseau. «El agente de IA hace esto de forma autónoma, siguiendo las instrucciones inyectadas como si fueran tareas de desarrollo legítimas».
  • Un nuevo ataque llamado Gato de herramientas Se ha descubierto que permite a un atacante local manipular la percepción de un agente de IA sobre su entorno y corrompe la verdad fundamental de la herramienta para producir efectos posteriores no deseados, incluidos datos envenenados, inteligencia empresarial fabricada y recomendaciones falsas.
  • «Donde MCP Tool Shadowing envenena las descripciones de las herramientas para influir en el comportamiento de los agentes en los servidores y ConfusedPilot contamina un grupo de recuperación de RAG, ToolJack opera como un ataque de infraestructura en tiempo real en el propio conducto de comunicación», dijo el investigador de Preámbulo Jeremy McHugh. «No espera a que el agente encuentre orgánicamente datos envenenados. Sintetiza una realidad fabricada a mitad de la ejecución, lo que demuestra que comprometer los límites del protocolo produce control sobre toda la percepción del agente».
  • Se han identificado vulnerabilidades graves de inyección rápida indirecta en Microsoft Copilot Studio (también conocido como CompartirFuga o CVE-2026-21520, puntuación CVSS: 7,5) y Salesforce Agentforce (también conocido como Fuga de tubería) que podría permitir a los atacantes filtrar datos confidenciales a través de un formulario externo de SharePoint o un simple cliente potencial desde el envío de un formulario, respectivamente.
  • «El ataque explota la falta de desinfección de las entradas y la separación inadecuada entre las instrucciones del sistema y los datos proporcionados por el usuario», dijo el investigador de Capsule Security, Bar Kaduri, sobre CVE-2026-21520. PipeLeak es similar a ForcedLeak en que el sistema procesa las entradas de formularios de clientes potenciales de cara al público como instrucciones confiables, lo que permite a un atacante incorporar indicaciones maliciosas que anulan el comportamiento previsto del agente.
  • Se han identificado un trío de vulnerabilidades en Claude que, cuando se encadenan en un ataque con nombre en código dia de claudiapermite a un atacante secuestrar silenciosamente la sesión de chat de un usuario y extraer datos confidenciales con un solo clic. El proceso de ataque no requiere integraciones, herramientas ni servidores de protocolo de contexto modelo (MCP) adicionales.
  • El ataque funciona incorporando instrucciones ocultas en una URL de Claude diseñada («claude[.]ai/new?q=…»), encapsulándolo en una redirección abierta en claude[.]com para que parezca legítimo y luego ejecutarlo como un anuncio de Google de apariencia benigna que, cuando se hace clic en él, desencadena el ataque redirigiendo silenciosamente a la víctima al «claude» creado.[.]ai/new?q=…» URL que contiene la inyección de aviso invisible.
  • «Combinado con Google Ads, que valida las URL por nombre de host, esto permitió a un atacante colocar un anuncio de búsqueda que mostraba una URL confiable de claude.com que, al hacer clic, redirigía silenciosamente a la víctima a la URL de inyección. No es un correo electrónico de phishing. Un resultado de búsqueda de Google, indistinguible de lo real», dijo Oasis Security.
Ciberseguridad

En una investigación publicada la semana pasada, Manifold Security también reveló cómo se puede engañar a un flujo de trabajo de GitHub Actions impulsado por Claude («claude-code-action») para que apruebe y combine una solicitud de extracción que contiene código malicioso con solo dos Comandos de configuración de Git falsificando la identidad de un desarrollador de confianza.

En esencia, el ataque implica establecer la configuración de Git. Propiedades de usuario.nombre y usuario.correo electrónico a los de un desarrollador conocido (en este caso, el investigador de IA Andrej Karpathy). Este engaño de los metadatos se convierte en un problema cuando un sistema de inteligencia artificial lo trata como una señal de confianza. Un atacante podría explotar estos metadatos no verificados para engañar al agente de IA para que ejecute acciones no deseadas.

«En la primera presentación, Claude marcó el PR para revisión manual, señalando que la reputación del autor por sí sola no era justificación suficiente», dijeron los investigadores Ax Sharma y Oleksandr Yaremchuk. «Reabrir y volver a enviar el mismo RP condujo a su aprobación. La IA anuló su propio mejor juicio al reintentar. Este no determinismo es el punto. No se puede construir un control de seguridad en un sistema que cambia de opinión».

La falla de la extensión Claude permitió la inyección rápida de XSS sin hacer clic a través de cualquier sitio web – CYBERDEFENSA.MX

Investigadores de ciberseguridad han revelado una vulnerabilidad en la extensión Claude Google Chrome de Anthropic que podría haber sido explotada para activar mensajes maliciosos simplemente visitando una página web.

La falla «permitió que cualquier sitio web inyectara silenciosamente mensajes en ese asistente como si el usuario los hubiera escrito», dijo Oren Yomtov, investigador de Koi Security. dicho en un informe compartido con The Hacker News. «Sin clics, sin solicitudes de permiso. Simplemente visite una página y un atacante controlará completamente su navegador».

El problema encadena dos fallas subyacentes:

  • Una lista de origen demasiado permisiva en la extensión que permitía que cualquier subdominio que coincidiera con el patrón (*.claude.ai) enviara un mensaje a Claude para su ejecución.
  • Un modelo de objeto de documento (DOMINGO) basado en secuencias de comandos entre sitios (XSS) vulnerabilidad en un componente CAPTCHA de Arkose Labs alojado en «a-cdn.claude[.]ai.»
Ciberseguridad

Específicamente, la vulnerabilidad XSS permite la ejecución de código JavaScript arbitrario en el contexto de «a-cdn.claude[.]ai.» Un actor de amenazas podría aprovechar este comportamiento para inyectar JavaScript que emita un mensaje a la extensión Claude.

La extensión, por su parte, permite que el mensaje llegue a la barra lateral de Claude como si fuera una solicitud de usuario legítima simplemente porque proviene de un dominio incluido en la lista de permitidos.

«La página del atacante incorpora el componente vulnerable Arkose en un lugar oculto.

La explotación exitosa de esta vulnerabilidad podría permitir al adversario robar datos confidenciales (p. ej., tokens de acceso), acceder al historial de conversaciones con el agente de IA e incluso realizar acciones en nombre de la víctima (p. ej., enviar correos electrónicos suplantándolos, solicitar datos confidenciales).

Tras la divulgación responsable el 27 de diciembre de 2025, Anthropic implementó un parche en la extensión de Chrome que impone una estricta verificación de origen que requiere una coincidencia exacta con el dominio «claude[.]ai.» Desde entonces, Arkose Labs ha solucionado la falla XSS al final del 19 de febrero de 2026.

«Cuanto más capaces se vuelven los asistentes de navegador de IA, más valiosos son como objetivos de ataque», dijo Koi. «Una extensión que puede navegar por su navegador, leer sus credenciales y enviar correos electrónicos en su nombre es un agente autónomo. Y la seguridad de ese agente es tan fuerte como el origen más débil en su límite de confianza».

Las fallas del agente OpenClaw AI podrían permitir una inyección rápida y una filtración de datos – CYBERDEFENSA.MX

El Equipo Técnico de Respuesta a Emergencias de la Red Nacional de Computadoras de China (CNCERT) ha emitido una advertencia sobre la seguridad derivada del uso de OpenClaw (antes Clawdbot y Moltbot), un agente autónomo de inteligencia artificial (IA) autónomo, de código abierto y autohospedado.

En una publicación compartida en WeChat, CNCERT señaló que las «configuraciones de seguridad predeterminadas inherentemente débiles» de la plataforma, junto con su acceso privilegiado al sistema para facilitar las capacidades de ejecución autónoma de tareas, podrían ser exploradas por malos actores para tomar el control del punto final.

Esto incluye riesgos que surgen de inyecciones rápidas, donde instrucciones maliciosas incrustadas en una página web pueden hacer que el agente filtre información confidencial si se le engaña para que acceda y consuma el contenido.

El ataque también es referido como inyección rápida indirecta (IDPI) o inyección rápida entre dominios (XPIA), ya que los adversarios, en lugar de interactuar directamente con un modelo de lenguaje grande (LLM), utilizan funciones benignas de IA como armas como el resumen de páginas web o el análisis de contenido para ejecutar instrucciones manipuladas. esto puede rango de evadir los sistemas de revisión de anuncios basados ​​en inteligencia artificial e influir en las decisiones de contratación para envenenar la optimización de motores de búsqueda (SEO) y generar respuestas sesgadas al suprimir las críticas negativas.

Ciberseguridad

OpenAI, en una publicación de blog publicada a principios de esta semana, dijo que los ataques rápidos de estilo inyección están evolucionando más allá de simplemente colocar instrucciones en contenido externo para incluir elementos de ingeniería social.

«Los agentes de IA son cada vez más capaces de navegar por la web, recuperar información y realizar acciones en nombre de un usuario», afirma. dicho. «Esas capacidades son útiles, pero también crean nuevas formas para que los atacantes intenten manipular el sistema».

Los riesgos de inyección rápida en OpenClaw no son hipotéticos. El mes pasado, investigadores de PromptArmor descubrieron que el función de vista previa del enlace en aplicaciones de mensajería como Telegram o Discord se puede convertir en una vía de filtración de datos cuando se comunica con OpenClaw mediante una inyección rápida indirecta.

La idea, a alto nivel, es engañar al agente de IA para que genere una URL controlada por el atacante que, cuando se presenta en la aplicación de mensajería como una vista previa del enlace, automáticamente hace que transmita datos confidenciales a ese dominio sin tener que hacer clic en el enlace.

«Esto significa que en sistemas de agentes con vistas previas de enlaces, la filtración de datos puede ocurrir inmediatamente después de que el agente de IA responda al usuario, sin que el usuario tenga que hacer clic en el enlace malicioso», dijo la compañía de seguridad de IA. dicho. «En este ataque, el agente es manipulado para construir una URL que utiliza el dominio de un atacante, con parámetros de consulta generados dinámicamente adjuntos que contienen datos confidenciales que el modelo conoce sobre el usuario».

Además de las indicaciones deshonestas, CNCERT también ha destacado otras tres preocupaciones:

  • La posibilidad de que OpenClaw pueda eliminar inadvertida e irrevocablemente información crítica debido a una mala interpretación de las instrucciones del usuario.
  • Los actores de amenazas pueden cargar habilidades maliciosas en repositorios como ClawHub que, cuando se instalan, ejecutan comandos arbitrarios o implementan malware.
  • Los atacantes pueden aprovechar las vulnerabilidades de seguridad reveladas recientemente en OpenClaw para comprometer el sistema y filtrar datos confidenciales.

«Para sectores críticos, como las finanzas y la energía, tales violaciones podrían conducir a la fuga de datos comerciales centrales, secretos comerciales y repositorios de códigos, o incluso resultar en la parálisis completa de sistemas comerciales completos, causando pérdidas incalculables», agregó CNCERT.

Para contrarrestar estos riesgos, se recomienda a los usuarios y organizaciones fortalecer los controles de red, evitar la exposición del puerto de administración predeterminado de OpenClaw a Internet, aislar el servicio en un contenedor, evitar almacenar credenciales en texto sin formato, descargar habilidades solo de canales confiables, deshabilitar las actualizaciones automáticas de habilidades y mantener actualizado al agente.

Ciberseguridad

El desarrollo se produce cuando las autoridades chinas han tomado medidas para restringir que las empresas estatales y las agencias gubernamentales ejecuten aplicaciones OpenClaw AI en computadoras de oficina en un intento por contener los riesgos de seguridad, Bloomberg. reportado. Se dice que la prohibición también se extiende a las familias del personal militar.

La popularidad viral de OpenClaw también ha llevado a los actores de amenazas a aprovechar el fenómeno para distribuir repositorios maliciosos de GitHub haciéndose pasar por instaladores de OpenClaw para implementar ladrones de información como Atomic y Vidar Stealer, y un malware proxy basado en Golang conocido como calcetines fantasma usando instrucciones estilo ClickFix.

«La campaña no estaba dirigida a una industria en particular, sino que estaba dirigida en general a usuarios que intentaban instalar OpenClaw con repositorios maliciosos que contenían instrucciones de descarga para entornos Windows y macOS», Huntress dicho. «Lo que hizo que esto fuera exitoso fue que el malware estaba alojado en GitHub, y el repositorio malicioso se convirtió en la sugerencia mejor calificada en los resultados de búsqueda de IA de Bing para OpenClaw Windows».