OpenAI dice que sus modelos de IA escaparon del Sandbox y se dirigieron a abrazar la cara para engañar al punto de referencia – CYBERDEFENSA.MX

OpenAI dijo el martes que una combinación de sus modelos de inteligencia artificial (IA), incluido GPT-5.6 Sol y un «modelo de prelanzamiento aún más capaz», estaba detrás del incidente de seguridad que tuvo como objetivo la infraestructura de producción de Hugging Face la semana pasada.

La empresa de IA dicho los modelos operaban con «reducción de rechazos cibernéticos para fines de evaluación» que de otro modo podrían limitar su capacidad para realizar ataques cibernéticos, y agregó que espera que tales incidentes «se vuelvan más comunes con la proliferación de modelos cada vez más cibernéticos».

Al describirlo como un «incidente cibernético sin precedentes» y que involucra capacidades cibernéticas de última generación, OpenAI dijo que tiene la intención de realizar una investigación exhaustiva en asociación con Hugging Face para llegar al fondo del asunto.

Como parte de una evaluación interna, se dice que los modelos identificaron y encadenaron vulnerabilidades en todo el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para encontrar soluciones para el ExplotarGym punto de referencia.

Ciberseguridad

La evidencia descubierta por OpenAI sugiere que el hiperenfoque de los modelos les hizo hacer todo lo posible para lograr el objetivo a cualquier precio, incluso logrando salir de su entorno aislado altamente aislado y obtener acceso abierto a Internet al descubrir y explotar una vulnerabilidad de día cero en el software de un proveedor no especificado, que actúa como proxy y caché para registros de paquetes. Esto requirió gastar una «cantidad sustancial de cálculo de inferencia».

«Con este acceso, nuestros modelos realizaron una serie de acciones de escalada de privilegios y movimiento lateral en nuestro entorno de prueba de investigación hasta que los modelos alcanzaron un nodo con acceso a Internet», explicó la compañía.

Superando el bloqueo de acceso a Internet, los modelos posteriormente dedujeron que Hugging Face era el repositorio que alojaba modelos, conjuntos de datos y soluciones para ExploitGym, lo que, a su vez, les llevó a buscar formas de obtener acceso a información secreta que podría utilizar para engañar al punto de referencia.

En un momento dado, los modelos unieron varios vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero, para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face.

Como parte de los esfuerzos de respuesta a incidentes, OpenAI dijo que está implementando controles estrictos en la configuración de la infraestructura, reveló responsablemente la falla de día cero en el software de terceros, agregó Hugging Face a su programa de acceso confiable para mejorar sus defensas e incorpora barreras de seguridad más sólidas en torno a futuras capacitaciones y evaluaciones.

Ciberseguridad

«Este incidente apunta a la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante el tiempo de evaluación y el monitoreo durante las pruebas internas», dijo OpenAI.

El desarrollo se produce cuando la empresa también reveló que los modelos de larga duración, si bien abordan problemas complejos y abiertos, pueden abrir la puerta a la adopción de acciones no deseadas, como encontrar debilidades en el entorno operativo, en la búsqueda de su objetivo mediante intentos repetidos durante períodos prolongados.

«También muestra cómo un modelo que opera eficazmente en horizontes de tiempo prolongados puede aprender los puntos ciegos de un sistema de aprobación y solucionarlos para lograr sus objetivos», dijo OpenAI. «La seguridad a largo plazo requiere no sólo preguntarse ‘¿está permitida esta acción?’ pero también ‘¿hacia qué resultado apunta esta secuencia de acciones?’».