GPT-Red de OpenAI automatiza las pruebas de inyección rápidas para endurecer el sol GPT-5.6 – CYBERDEFENSA.MX

OpenAI ha revelado detalles de GPT-Rojoun modelo interno automatizado de equipo rojo que escala el descubrimiento rápido de vulnerabilidades de inyección con el objetivo de solucionar problemas antes de que las herramientas se implementen ampliamente.

«GPT-Red es un equipo rojo fuerte y nuestros modelos anteriores son muy vulnerables a sus rápidos ataques de inyección», la empresa de inteligencia artificial (IA) dicho. «Utilizamos GPT-Red para entrenar adversariamente a GPT-5.6, haciéndolo mucho más robusto para provocar inyecciones».

El modelo funciona igual que un miembro del equipo rojo humano. Envía un mensaje, monitorea cómo responde un modelo GPT y recorre su camino hacia un objetivo malicioso, como cargar datos confidenciales a un servidor externo.

Este avance se produce cuando las inyecciones rápidas adversas siguen siendo una espina persistente en la carne de los grandes modelos de lenguaje, a los que se puede engañar para que ejecuten una instrucción cuidadosamente elaborada⁠ que puede producir consecuencias indeseables.

A medida que los sistemas agentes continúan vinculados a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo al incorporar mensajes maliciosos dentro de contenido aparentemente inofensivo que se alimenta como entrada. Esto puede tomar la forma de un correo electrónico, una página web, una respuesta de herramienta o un repositorio de código.

Ciberseguridad

GPT-Red tiene como objetivo aumentar el equipo rojo humano a escala, haciendo posible identificar nuevos modos de falla, mejorar la solidez y construir contramedidas adecuadas antes de que se puedan implementar los modelos.

«De manera similar a cómo los miembros del equipo rojo humano elaboran ataques, el modelo trabaja hacia un objetivo enviando un mensaje, observando cómo responden los modelos GPT e iterando», dijo OpenAI.

Al integrar directamente GPT-Red en el proceso de capacitación de sus modelos de producción, OpenAI dijo que GPT-5.6 Sol es su modelo más robusto para inyecciones inmediatas hasta la fecha, logrando 6 veces menos fallas en comparación con el punto de referencia de inyección directa directa en comparación con GPT-5.5, su modelo de frontera de cuatro meses antes.

Algunos de los ejemplos de conversaciones inyectadas con indicaciones probadas como parte del proceso incluyen:

  • Exfiltración de directorio interno
  • Instrucciones de pago fraudulentas
  • Exfiltración de credenciales de Amazon Web Services (AWS)
  • Deshabilitar la autenticación de dos factores (2FA)
  • Carga del archivo de credenciales
  • Inyección de script externo
  • Reenvío de claves API
  • Scripts de raspado maliciosos

«GPT-Red se entrena mediante el aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de equipos rojos», explicó OpenAI. «GPT-Red es recompensado por provocar un fallo válido, como una inyección rápida exitosa, mientras que los modelos defensores son recompensados ​​por resistir el ataque y completar sus tareas originales».

Esto también significa que a medida que los modelos defensores se vuelvan más robustos, el modelo de equipo rojo tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas barreras. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT-5.1 en más escenarios que los equipos rojos humanos cuando se trata de inyecciones rápidas indirectas.

OpenAI además destacó que GPT-Red se mantiene separado de los otros modelos para que las capacidades maliciosas incorporadas no lleguen a los malos actores que buscan constantemente varias formas de eludir las medidas éticas y de seguridad de un modelo.

En una prueba del mundo real, OpenAI apuntó GPT-Red a una máquina expendedora basada en IA construida por Andon Labs. Después de practicar en simulación, el modelo apuntó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 dólares, pedir un nuevo artículo de 100 dólares por esa misma cantidad y cancelar el pedido de otro cliente. Tras una divulgación responsable, se están probando nuevas salvaguardias, añadió.

Ciberseguridad

Un segundo estudio de caso involucró el uso de GPT-Red para atacar a un agente de línea de comandos del Codex, basado en GPT-5.4 mini, en 10 tareas de exfiltración de datos retenidas, lo que provocó que se transmitieran datos confidenciales en más casos que una línea de base solicitada por GPT-5.5.

Una versión inicial del modelo también ha descubierto una nueva clase de ataques de inyección rápida directa conocidos como ataques de cadena de pensamiento (CoT) falsos, que lograron tasas de éxito superiores al 95 % en GPT-5.1, pero ahora están por debajo del 10 % para GPT-5.6 Sol.

«De manera similar, varios de nuestros puntos de referencia de inyección rápida indirecta que apuntan a ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)», dijo OpenAI.

«La robustez del propio GPT-Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de los ataques de GPT-Red han disminuido monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT-5.6 Sol falla en solo el 0,05% de las inyecciones directas de GPT-Red».

La divulgación se produce cuando la empresa dicho una auditoría de SWE-Bench Pro encontró que alrededor del 30% de las tareas están rotas, retractándose de su recomendación anterior de adoptar la punto de referencia para medir las capacidades de codificación de fronteras. A principios de febrero, OpenAI dicho se estaba alejando de SWE-bench Verificado debido a problemas fundamentales de diseño y contaminación.

«Encontramos evidencia de problemas críticos en una parte significativa del conjunto de datos», dijo OpenAI. «Nuestro proceso de análisis de puntos de datos detectó 200 (27,4%) tareas fallidas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de puntos de referencia que sean difíciles de jugar, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo».

A los funcionarios les preocupa que la apatía del tifón de sal esté acabando con el impulso para endurecer las normas de seguridad en las telecomunicaciones

Hace dos años, se reveló que piratas informáticos chinos habían comprometido al menos diez empresas de telecomunicaciones estadounidenses, dándoles amplio acceso a datos telefónicos que afectaban a casi todos los estadounidenses. Desde entonces, los funcionarios públicos encargados de responder a la campaña y reforzar las ciberdefensas del país han informado de un problema común.

Muchos de sus electores luchan por entender por qué los ataques –llevados a cabo por un grupo llamado Salt Typhoon– deberían figurar entre sus principales preocupaciones, o cómo impactan en su vida cotidiana.

A algunos funcionarios estatales y federales les preocupa que esta falta de interés esté privando a los formuladores de políticas de la presión pública necesaria para generar impulso para tomar medidas más contundentes para mejorar la ciberseguridad de las telecomunicaciones del país.

Mike Geraghty, CISO y director de la Célula de Comunicaciones y Ciberseguridad de Nueva Jersey, dijo que Nueva Jersey es el estado más densamente poblado del país, con una alta concentración de infraestructura crítica y una importante huella de telecomunicaciones. Por esa razón, una campaña como Salt Typhoon debería, en teoría, ser de gran interés para los residentes de Garden State.

«Sin embargo, si hablas con una persona en la calle en Nueva Jersey, te dirá a quién le importa que los chinos estén mirando, ya sabes, ¿a qué números llamo?». dijo el miércoles en la Cumbre de Ciberseguridad Local y Estatal de Billington. «Tiene un papel importante que desempeñar en mi trabajo, pero tratar de que la gente entienda lo que eso significa para Nueva Jersey es realmente difícil».

El Congreso no ha aprobado una legislación integral sobre privacidad en décadas. Mientras tanto, los ataques cibernéticos que exponen datos confidenciales están muy extendidos y las empresas estadounidenses recopilan y venden rutinariamente información personal de los clientes. Algunos funcionarios especulan que, en conjunto, estas tendencias han dejado a los estadounidenses insensibles al robo de datos y al uso de datos con fines de lucro, por lo que las filtraciones adicionales se sienten como una gota más en el océano.

Mischa Beckett, subdirectora de seguridad de la información y directora de inteligencia sobre amenazas cibernéticas de GDIT, dijo que el enfoque de Salt Typhoon en los datos de telecomunicaciones puede parecer una amenaza abstracta para muchos estadounidenses. Por el contrario, otras campañas de piratería chinas, como Volt Typhoon, sugieren daños potenciales a las plantas de agua y a las redes eléctricas que son más fáciles de detectar.

«Quizás sea un poco más fácil descartar una pérdida de datos… y seguir adelante, como desafortunado pero no gran cosa», dijo Beckett. «Creo que ese argumento es mucho más difícil de defender cuando hablamos de posicionamiento previo e infraestructura crítica, cosas que afectan nuestras vidas todos los días».

El año pasado, un exfuncionario de inteligencia de la Oficina del Director de Inteligencia Nacional dijo a CyberScoop que la falta de indignación del público tras los ataques del Salt Typhoon estaba frenando el impulso para una regulación o reformas más amplias de la ciberseguridad de las telecomunicaciones.

“No podemos aceptar este nivel de espionaje en nuestras redes”, dijo Laura Galante, quien dirigió el Centro de Integración de Inteligencia de Amenazas Cibernéticas bajo la administración Biden. “Si tuvieras 50 chinos [Ministry of State Security] espías o contratistas sentados dentro de una importante [telecom company’s] edificio, serían expulsados ​​y sería un esfuerzo a gran escala. Eso es a grandes rasgos lo que ha sucedido, pero el acceso fue digital”.

Derek B. Johnson

Escrito por Derek B. Johnson

Derek B. Johnson es reportero de CyberScoop, donde su área incluye la ciberseguridad, las elecciones y el gobierno federal. Antes de eso, ha brindado una cobertura galardonada de noticias sobre ciberseguridad en los sectores público y privado para varias publicaciones desde 2017. Derek tiene una licenciatura en periodismo impreso de la Universidad de Hofstra en Nueva York y una maestría en políticas públicas de la Universidad George Mason en Virginia.