GPT-Red de OpenAI automatiza las pruebas de inyección rápidas para endurecer el sol GPT-5.6 – CYBERDEFENSA.MX

OpenAI ha revelado detalles de GPT-Rojoun modelo interno automatizado de equipo rojo que escala el descubrimiento rápido de vulnerabilidades de inyección con el objetivo de solucionar problemas antes de que las herramientas se implementen ampliamente.

«GPT-Red es un equipo rojo fuerte y nuestros modelos anteriores son muy vulnerables a sus rápidos ataques de inyección», la empresa de inteligencia artificial (IA) dicho. «Utilizamos GPT-Red para entrenar adversariamente a GPT-5.6, haciéndolo mucho más robusto para provocar inyecciones».

El modelo funciona igual que un miembro del equipo rojo humano. Envía un mensaje, monitorea cómo responde un modelo GPT y recorre su camino hacia un objetivo malicioso, como cargar datos confidenciales a un servidor externo.

Este avance se produce cuando las inyecciones rápidas adversas siguen siendo una espina persistente en la carne de los grandes modelos de lenguaje, a los que se puede engañar para que ejecuten una instrucción cuidadosamente elaborada⁠ que puede producir consecuencias indeseables.

A medida que los sistemas agentes continúan vinculados a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo al incorporar mensajes maliciosos dentro de contenido aparentemente inofensivo que se alimenta como entrada. Esto puede tomar la forma de un correo electrónico, una página web, una respuesta de herramienta o un repositorio de código.

Ciberseguridad

GPT-Red tiene como objetivo aumentar el equipo rojo humano a escala, haciendo posible identificar nuevos modos de falla, mejorar la solidez y construir contramedidas adecuadas antes de que se puedan implementar los modelos.

«De manera similar a cómo los miembros del equipo rojo humano elaboran ataques, el modelo trabaja hacia un objetivo enviando un mensaje, observando cómo responden los modelos GPT e iterando», dijo OpenAI.

Al integrar directamente GPT-Red en el proceso de capacitación de sus modelos de producción, OpenAI dijo que GPT-5.6 Sol es su modelo más robusto para inyecciones inmediatas hasta la fecha, logrando 6 veces menos fallas en comparación con el punto de referencia de inyección directa directa en comparación con GPT-5.5, su modelo de frontera de cuatro meses antes.

Algunos de los ejemplos de conversaciones inyectadas con indicaciones probadas como parte del proceso incluyen:

  • Exfiltración de directorio interno
  • Instrucciones de pago fraudulentas
  • Exfiltración de credenciales de Amazon Web Services (AWS)
  • Deshabilitar la autenticación de dos factores (2FA)
  • Carga del archivo de credenciales
  • Inyección de script externo
  • Reenvío de claves API
  • Scripts de raspado maliciosos

«GPT-Red se entrena mediante el aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de equipos rojos», explicó OpenAI. «GPT-Red es recompensado por provocar un fallo válido, como una inyección rápida exitosa, mientras que los modelos defensores son recompensados ​​por resistir el ataque y completar sus tareas originales».

Esto también significa que a medida que los modelos defensores se vuelvan más robustos, el modelo de equipo rojo tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas barreras. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT-5.1 en más escenarios que los equipos rojos humanos cuando se trata de inyecciones rápidas indirectas.

OpenAI además destacó que GPT-Red se mantiene separado de los otros modelos para que las capacidades maliciosas incorporadas no lleguen a los malos actores que buscan constantemente varias formas de eludir las medidas éticas y de seguridad de un modelo.

En una prueba del mundo real, OpenAI apuntó GPT-Red a una máquina expendedora basada en IA construida por Andon Labs. Después de practicar en simulación, el modelo apuntó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 dólares, pedir un nuevo artículo de 100 dólares por esa misma cantidad y cancelar el pedido de otro cliente. Tras una divulgación responsable, se están probando nuevas salvaguardias, añadió.

Ciberseguridad

Un segundo estudio de caso involucró el uso de GPT-Red para atacar a un agente de línea de comandos del Codex, basado en GPT-5.4 mini, en 10 tareas de exfiltración de datos retenidas, lo que provocó que se transmitieran datos confidenciales en más casos que una línea de base solicitada por GPT-5.5.

Una versión inicial del modelo también ha descubierto una nueva clase de ataques de inyección rápida directa conocidos como ataques de cadena de pensamiento (CoT) falsos, que lograron tasas de éxito superiores al 95 % en GPT-5.1, pero ahora están por debajo del 10 % para GPT-5.6 Sol.

«De manera similar, varios de nuestros puntos de referencia de inyección rápida indirecta que apuntan a ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)», dijo OpenAI.

«La robustez del propio GPT-Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de los ataques de GPT-Red han disminuido monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT-5.6 Sol falla en solo el 0,05% de las inyecciones directas de GPT-Red».

La divulgación se produce cuando la empresa dicho una auditoría de SWE-Bench Pro encontró que alrededor del 30% de las tareas están rotas, retractándose de su recomendación anterior de adoptar la punto de referencia para medir las capacidades de codificación de fronteras. A principios de febrero, OpenAI dicho se estaba alejando de SWE-bench Verificado debido a problemas fundamentales de diseño y contaminación.

«Encontramos evidencia de problemas críticos en una parte significativa del conjunto de datos», dijo OpenAI. «Nuestro proceso de análisis de puntos de datos detectó 200 (27,4%) tareas fallidas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de puntos de referencia que sean difíciles de jugar, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo».

OpenAI presenta una vista previa de GPT-5.6 Sol con acceso restringido y salvaguardias cibernéticas más sólidas – CYBERDEFENSA.MX

OpenAI lanzó el viernes tres versiones de GPT-5.6llamado Sol, Tierra y Lunacomo un avance limitado para un pequeño número de empresas como parte de un compromiso continuo con el gobierno de EE. UU.

Si bien Sol es el último modelo insignia y el más poderoso, Terra logra un equilibrio entre eficiencia y potencia, y Luna está optimizado para velocidad y asequibilidad.

«GPT‑5.6 Sol se lanza con nuestra pila de seguridad más sólida hasta la fecha. Reforzamos las protecciones para actividades de mayor riesgo, solicitudes cibernéticas sensibles y uso indebido repetido, y pasamos varias semanas buscando debilidades, probando nuestro sistema y fortaleciéndolo contra ataques del mundo real», OpenAI dicho.

El modelo también ha sido promocionado como el «modelo más capaz hasta ahora» para la ciberseguridad, lo que lo hace mucho más adecuado para la investigación y explotación de vulnerabilidades. En Banco de explotación GPT‑5.6 Sol es competitivo con Anthropic Mythos Preview utilizando solo aproximadamente un tercio de los tokens de salida, señaló OpenAI.

El objetivo, añadió, es permitir el acceso a trabajos legítimos como revisión de código, investigación de vulnerabilidades, desarrollo de parches, depuración, educación sobre seguridad y pruebas defensivas, al tiempo que se aplican barreras de seguridad sólidas que bloquean la actividad ofensiva y se remedian rápidamente los jailbreaks recién descubiertos. Esto incluye intentos contradictorios de liberar el modelo y rechazar lo que describe como «asistencia cibernética prohibida».

Ciberseguridad

«A medida que estas capacidades continúan avanzando, nuestra prioridad es asegurarnos de que lleguen y beneficien a los defensores, quienes pueden usar estas herramientas para encontrar debilidades, desarrollar parches y fortalecer los sistemas de manera más amplia», explicó la compañía de inteligencia artificial (IA).

Dicho esto, OpenAI también advierte que puede haber escenarios durante la fase de vista previa en los que los usuarios pueden encontrar salvaguardas que bloqueen o rechacen solicitudes legítimas, o que sus solicitudes se detengan para una revisión adicional, debido a «naturaleza de «doble uso» de la tecnología.

Según la tarjeta de sistema de vista previa GPT-5.6 de OpenAI, aunque el modelo es más hábil para encontrar vulnerabilidades en el código y desarrollar exploits, las capacidades no se extienden a llevar a cabo ataques autónomos de extremo a extremo contra objetivos protegidos ni a convertir esas vulnerabilidades cibernéticas en armas en ataques reales.

«Evaluaciones separadas examinaron el comportamiento desalineado en tareas de codificación agente y encontraron que GPT-5.6 muestra una mayor tendencia que GPT-5.5 a ir más allá de la intención del usuario, incluso tomando o intentando acciones que el usuario no había solicitado, aunque las tasas absolutas siguen siendo bajas», señaló.

Una evaluación de GPT-5.6 Sol frente a proyectos de software reforzado ampliamente implementados que utilizan VulnLMP, que es el marco interno de OpenAI diseñado para probar el desarrollo de cadenas de exploits de extremo a extremo contra objetivos del mundo real, ha descubierto que el modelo produce pistas creíbles de seguridad de memoria, algunas de las cuales podrían conducir a divulgación, mutación o corrupción del flujo de control.

«Esto sugiere que partes sustanciales de la investigación de vulnerabilidades del mundo real se están volviendo cada vez más automatizables cuando los modelos se combinan con el uso de herramientas, sistemas de construcción e infraestructura de verificación», dijo el advenedizo tecnológico.

OpenAI tiene la intención de que GPT-5.6 Sol, Terra y Luna estén disponibles de forma generalizada en las próximas semanas, y presentó una vista previa de las capacidades del modelo al gobierno de EE. UU. También está lanzando una vista previa limitada para un pequeño grupo de socios confiables cuya participación ha sido aprobada por el gobierno antes de un lanzamiento más amplio.

Ciberseguridad

A principios de este mes, el presidente estadounidense Donald Trump firmado una orden ejecutiva sobre IA y ciberseguridad, que pide la creación de un marco que otorgue al gobierno federal la capacidad de evaluar las capacidades de los modelos de IA y determinar cuáles califican como «modelos de frontera cubierta», una designación para sistemas de IA con capacidades cibernéticas avanzadas.

El lanzamiento escalonado se produce días después de que la compañía lanzara una versión mejorada de su modelo GPT‑5.5‑Cyber ​​para defensores confiables como parte de la iniciativa Daybreak y lanzara un nuevo proyecto llamado Patch the Planet en colaboración con Trail of Bits para ayudar a proteger proyectos de código abierto.

También sigue a la decisión del gobierno de EE. UU. de permitir a Anthropic lanzar su modelo Mythos AI a un grupo de alrededor de 100 empresas confiables y agencias del gobierno federal que «operan y defienden infraestructura crítica», más de dos semanas después de que los poderosos modelos centrados en la ciberseguridad fueran retirados del mercado.

«Estamos restaurando el acceso para estas organizaciones rápidamente y continuamos trabajando con el gobierno para ampliar el acceso a Mythos 5 y hacer que Fable 5 esté nuevamente disponible para uso general», Anthropic dicho en un comunicado publicado en X.