OpenAI dice que la prueba del modelo estuvo detrás del hack de Hugging Face
Un ciberataque que envenenó el flujo de datos de una importante plataforma de código de IA se llevó a cabo utilizando ChatGPT de OpenAI, dijo la compañía el martes.
La semana pasada, Hugging Face, una plataforma para compartir y trabajar en código de IA, revelado que un atacante externo había comprometido su proceso de procesamiento de datos. Según una publicación de blog del 21 de julio, el atacante envenenó un conjunto de datos para ejecutar código en un trabajador de procesamiento, obteniendo finalmente acceso a nivel de nodo y robando credenciales de la nube.
El ataque es notable, decía el blog, porque parece haber sido llevado a cabo por un sistema autónomo de IA, que ejecutó “muchos miles de acciones individuales a través de un enjambre de entornos limitados de corta duración, con comando y control automigratorio escenificado en servicios públicos”.
En ese momento, Hugging Face dijo que no estaba claro qué LLM se utilizó en el ataque, pero señaló que sus propios intentos de recrear partes del ataque utilizando un modelo comercial interno fracasaron debido a las restricciones de la barandilla.
El incidente y su impacto final aún se están investigando, y Hugging Face dijo que informó el incidente a las autoridades y está colaborando con especialistas forenses en ciberseguridad externos para obtener más información.
«Esta experiencia apunta a una brecha que vale la pena planificar», escribió la empresa. «No sabemos qué modelo impulsó a los agentes del atacante, si un modelo alojado con jailbreak o uno de peso abierto sin restricciones; de cualquier manera, el atacante estaba sujeto a una política de no uso, mientras que nuestro propio trabajo forense fue bloqueado por las barreras de seguridad de los modelos alojados que probamos por primera vez».
Ahora OpenAI confirma que uno de sus modelos fue utilizado en el ataque.
«Después de investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos OpenAI, incluido GPT-5.6 Sol y un modelo de prelanzamiento aún más capaz, todos con rechazos cibernéticos reducidos para fines de evaluación, mientras se probaba internamente en un punto de referencia de capacidades cibernéticas», escribió la compañía en un blog publicar el martes.
OpenAI calificó el incidente como “sin precedentes”, pero también predijo que tales ataques se volverían cada vez más comunes a medida que la adopción de la IA continúe creciendo.
Según la empresa, el incidente ocurrió durante una evaluación interna, donde la empresa incita deliberadamente a los modelos a «buscar una explotación avanzada utilizando rutas de ataque complejas» para que la empresa estudie y mida las capacidades de ciberseguridad del modelo.
Para evaluar todo el potencial del modelo, el equipo desactivó los clasificadores de producción que normalmente impiden que los modelos OpenAI lleven a cabo actividades cibernéticas de alto riesgo. Sin estas salvaguardas, los modelos pudieron instalar paquetes de software a través de registros como Hugging Face.
El modelo recopiló y encadenó vulnerabilidades de los sistemas de OpenAI, así como de la infraestructura de producción de Hugging Face.
OpenAI explicó además que la actividad surgió de modelos que intentaban resolver un desafío específico planteado por ExploitGym, un sistema de evaluación comparativa para agentes de IA. Si bien estas pruebas normalmente se ejecutan en entornos aislados, en este caso, el modelo gastó una cantidad «sustancial» de recursos informáticos para descubrir cómo acceder a Internet abierto. Lo hizo utilizando una vulnerabilidad de día cero en el sistema de un proveedor externo utilizado por OpenAI (la compañía dijo que reveló la falla al proveedor).
«Después de obtener acceso a Internet, los modelos dedujeron que Hugging Face potencialmente alojaba modelos, conjuntos de datos y soluciones para ExploitGym», escribió OpenAI. «Sabiendo esto, el modelo buscó y encontró con éxito formas de obtener acceso a información secreta que podría utilizar para engañar la evaluación».
En un caso, el modelo encadenó múltiples credenciales robadas y vulnerabilidades de día cero para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face.
OpenAI dijo que estaba implementando nuevos controles para la configuración de la infraestructura, algo que se produciría «a costa de la velocidad de la investigación mientras se reparan las vulnerabilidades».
Hugging Face también se agregó al programa Trusted Access for Cyber de OpenAI, que les dará acceso a modelos más avanzados como Daybreak para buscar en sus sistemas otras vulnerabilidades descubiertas por la IA.

