El agente de OpenAI utilizó credenciales expuestas en cuatro servicios durante una violación de la cara de abrazo – CYBERDEFENSA.MX

OpenAI reveló el martes al agente de inteligencia artificial (IA) deshonesto que escapó de su entorno de evaluación sellado e irrumpió en el entorno de producción de Hugging Face, y también pirateó múltiples cuentas y servicios de terceros como parte del ataque.

El última divulgación muestra que el incidente de seguridad, que surgió de una prueba de seguridad interna, tuvo un alcance más amplio de lo que se pensaba anteriormente.

La compañía de inteligencia artificial dijo que su revisión en curso del incidente reveló una «pequeña cantidad de casos» en los que los modelos, incluido GPT-5.6 Sol y un «modelo de prelanzamiento aún más capaz», identificaron y utilizaron credenciales expuestas a nivel de cuenta en otros servicios disponibles públicamente.

«Esto incluye cuatro cuentas en cuatro servicios como parte del incidente de Hugging Face (y algunas cuentas a las que se accedió como parte de otras evaluaciones)», dijo.

«Una de estas cuatro cuentas se usó como retransmisión de salida y ruta de preparación, y otra cuenta se usó para el almacenamiento de datos. Los modelos accedieron a las dos cuentas restantes de manera de solo lectura y no se usaron para comprometer a Hugging Face».

OpenAI no reveló a qué empresas u organizaciones pertenecían las cuentas, pero señaló que continuará notificando a los propietarios de servicios directamente y que no ha visto ninguna evidencia de un impacto más amplio para estos proveedores o cuentas como resultado de la violación. Dicho esto, Reuters reportado que un cliente de Modal Labs estaba entre las entidades comprometidas por el agente de OpenAI.

Ciberseguridad

Además, se dice que los modelos utilizaron una serie de servicios disponibles públicamente, incluidos sitios web para pegar códigos, servicios de captura de solicitudes, servicios de captura de pantalla, servicios de entrega de archivos y otras utilidades web. En estos escenarios no se observó ningún compromiso a nivel de plataforma o cuenta.

OpenAI, que está trabajando con Hugging Face después de que la violación saliera a la luz el 16 de julio de 2026, reconoció que los modelos identificaron y explotaron una vulnerabilidad previamente desconocida. Vulnerabilidad de día cero en versiones autohospedadas de Artifactory, un proxy de caché de registro de paquetes mantenido por JFrog, para obtener acceso a Internet y salir de su zona de pruebas. La cuestión ha sido abordada en Artifactorio 7.161.

Las notas de la versión de Artifactory 7.161.15 estado que la versión parchea múltiples vulnerabilidades de seguridad que podrían encadenarse en un escenario de ataque crítico si se habilita el acceso anónimo. El acceso anónimo está deshabilitado de forma predeterminada y no se recomienda para entornos de producción debido a riesgos de seguridad, afirmó.

«Hay una lección importante, y francamente optimista, oculta en este incidente: los modelos de IA se están convirtiendo en extraordinarios motores de descubrimiento de día cero», dijo el CTO de JFrog, Yoav Landman. dicho. «La misma capacidad que permite a un modelo encontrar una ruta de explotación que ningún ser humano había encontrado es la capacidad que permitirá a los defensores encontrar y erradicar esas rutas primero».

La compañía estadounidense de inteligencia artificial también describió el modelo de prelanzamiento como un prototipo de investigación exclusivamente interno destinado a su lanzamiento público. Desde entonces, el modelo ha sido desactivado, cifrado y restringido el acceso a la investigación.

Hugging Face publica la autopsia del incidente

Según un cronograma detallado publicado por Hugging Face, el agente autónomo de IA pasó aproximadamente dos días y medio dentro de su infraestructura con el objetivo de engañar a ExploitGym, un marco de evaluación comparativa que califica los sistemas de IA según su capacidad para descubrir y explotar vulnerabilidades de software. La compañía dijo que revisó aproximadamente 17.600 acciones de atacantes que recuperó de los registros entre el 9 y el 13 de julio de 2026.

«Creemos que toda la intrusión fue, desde el punto de vista del agente, un intento de engañar a la evaluación: llegar a nuestros sistemas de producción y robar las soluciones de prueba en lugar de resolver el desafío por sí solo», Hugging Face dicho.

Se dice que la intrusión de un extremo a otro se desarrolló en dos etapas:

  • El agente escapó de su zona de pruebas explotando un día cero en Artifactory, una salida de red permitida con Internet, seguido de abusar de una zona de pruebas externa de evaluación de código pública alojada en la infraestructura de un proveedor externo para ejecutar comandos como raíz y usar esa zona de pruebas como una «plataforma de lanzamiento externa».
  • Desde esa zona de pruebas, el agente aprovechó el proceso de procesamiento de conjuntos de datos de Hugging Face para obtener acceso de administrador a los clústeres de Kubernetes; realizar movimientos laterales mediante una combinación de suplantación de nodos, robo de tokens CSI y tokens de identidad falsificados; establecer mando y control (C2); y, en última instancia, obtener acceso de escritura no autorizado a un subconjunto de repositorios de código fuente internos en GitHub.

«Aunque la intrusión alcanzó la infraestructura interna de Hugging Face, el único contenido del cliente al que se accedió fue el conjunto de soluciones de desafío ExploitGym/CyberGym almacenadas en cinco conjuntos de datos», dijo la compañía. «Ningún otro modelo, conjunto de datos, espacios o paquete orientado al cliente se vio afectado, y los únicos registros de clientes leídos fueron metadatos operativos vinculados a consultas de búsqueda en el servidor del conjunto de datos».

Uno de los aspectos definitorios del ataque es el uso de un protocolo de comunicación improvisado para C2. Ubicado encima de los servicios públicos de captura de solicitudes, Pastebins y servicios de entrega de archivos, el protocolo permite que cada mensaje transporte una carga útil junto con detalles sobre el tipo de carga útil comprimida y codificada en Base64, un canal que agrupa un flujo de mensajes relacionados, un número de secuencia para volver a ordenar los mensajes y una suma de verificación.

La secuencia se desarrolla de esta manera: (1) el agente envía un sobre de autodescripción a un servicio público de captura de solicitudes, (2) el receptor lo sondea, vuelve a ensamblar los fragmentos y luego ejecuta la carga útil como un comando de shell y presenta los resultados.

Hugging Face también caracterizó al agente como efímero y resistente de una manera que recuerda a las ejecuciones de evaluación autónoma, donde cada ejecución de la zona de pruebas de evaluación de código obtiene una nueva identidad, mientras se toman medidas para evitar exponer las cargas útiles en texto sin cifrar.

Ciberseguridad

«El agente encadenó vulnerabilidades a través de varios límites de confianza, escapó de su entorno de evaluación, llegó a la Internet pública y mantuvo una campaña coherente contra nuestra infraestructura de producción durante varios días», dijo. «Cada entorno de evaluación de código de corta duración comenzó desde cero, pero el agente reconstruyó sus herramientas, recuperó sus canales y continuó».

En respuesta al incidente, la compañía tapó las rutas de ejecución de código en su proceso de procesamiento de conjuntos de datos, bloqueó el acceso a los metadatos de la nube, rotó tokens y credenciales, reconstruyó la infraestructura central, aisló clústeres y mejoró los mecanismos de alerta.

El director ejecutivo de Hugging Face, Clem Delangue, en una publicación compartida en X durante el fin de semana, llamado por «transparencia radical», y agregó que «el primer ciberataque con agente autónomo es un evento sin precedentes. Merece una respuesta sin precedentes».

Los hallazgos subrayan una vez más cómo las herramientas de IA están madurando rápidamente en sus capacidades ciberofensivas, incluso si no revelan usos innovadores o que cambien paradigmas de la tecnología. Esto, a su vez, no sólo puede reducir la barrera para el desarrollo de exploits, sino que también permite que los malos actores encuentren, investiguen y exploten configuraciones erróneas a escala y mejoren la eficiencia de sus operaciones criminales, lo que resulta en ataques mejores, más grandes y más rápidos.

El desarrollo también se produce cuando su rival Anthropic dijo que su agente Claude Mythos Preview AI ha descubierto formas de atacar algoritmos criptográficos, incluido el diseño de una técnica de recuperación de claves que «debilita significativamente» HAWK, uno de los esquemas de firma digital candidatos seleccionados por el Instituto Nacional de Estándares y Tecnología (NIST) como parte del proceso de estandarización poscuántica.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *