GPT-Red de OpenAI automatiza las pruebas de inyección rápidas para endurecer el sol GPT-5.6 – CYBERDEFENSA.MX
OpenAI ha revelado detalles de GPT-Rojoun modelo interno automatizado de equipo rojo que escala el descubrimiento rápido de vulnerabilidades de inyección con el objetivo de solucionar problemas antes de que las herramientas se implementen ampliamente.
«GPT-Red es un equipo rojo fuerte y nuestros modelos anteriores son muy vulnerables a sus rápidos ataques de inyección», la empresa de inteligencia artificial (IA) dicho. «Utilizamos GPT-Red para entrenar adversariamente a GPT-5.6, haciéndolo mucho más robusto para provocar inyecciones».
El modelo funciona igual que un miembro del equipo rojo humano. Envía un mensaje, monitorea cómo responde un modelo GPT y recorre su camino hacia un objetivo malicioso, como cargar datos confidenciales a un servidor externo.
Este avance se produce cuando las inyecciones rápidas adversas siguen siendo una espina persistente en la carne de los grandes modelos de lenguaje, a los que se puede engañar para que ejecuten una instrucción cuidadosamente elaborada que puede producir consecuencias indeseables.
A medida que los sistemas agentes continúan vinculados a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo al incorporar mensajes maliciosos dentro de contenido aparentemente inofensivo que se alimenta como entrada. Esto puede tomar la forma de un correo electrónico, una página web, una respuesta de herramienta o un repositorio de código.
GPT-Red tiene como objetivo aumentar el equipo rojo humano a escala, haciendo posible identificar nuevos modos de falla, mejorar la solidez y construir contramedidas adecuadas antes de que se puedan implementar los modelos.
«De manera similar a cómo los miembros del equipo rojo humano elaboran ataques, el modelo trabaja hacia un objetivo enviando un mensaje, observando cómo responden los modelos GPT e iterando», dijo OpenAI.
Al integrar directamente GPT-Red en el proceso de capacitación de sus modelos de producción, OpenAI dijo que GPT-5.6 Sol es su modelo más robusto para inyecciones inmediatas hasta la fecha, logrando 6 veces menos fallas en comparación con el punto de referencia de inyección directa directa en comparación con GPT-5.5, su modelo de frontera de cuatro meses antes.
Algunos de los ejemplos de conversaciones inyectadas con indicaciones probadas como parte del proceso incluyen:
- Exfiltración de directorio interno
- Instrucciones de pago fraudulentas
- Exfiltración de credenciales de Amazon Web Services (AWS)
- Deshabilitar la autenticación de dos factores (2FA)
- Carga del archivo de credenciales
- Inyección de script externo
- Reenvío de claves API
- Scripts de raspado maliciosos
«GPT-Red se entrena mediante el aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de equipos rojos», explicó OpenAI. «GPT-Red es recompensado por provocar un fallo válido, como una inyección rápida exitosa, mientras que los modelos defensores son recompensados por resistir el ataque y completar sus tareas originales».
Esto también significa que a medida que los modelos defensores se vuelvan más robustos, el modelo de equipo rojo tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas barreras. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT-5.1 en más escenarios que los equipos rojos humanos cuando se trata de inyecciones rápidas indirectas.
OpenAI además destacó que GPT-Red se mantiene separado de los otros modelos para que las capacidades maliciosas incorporadas no lleguen a los malos actores que buscan constantemente varias formas de eludir las medidas éticas y de seguridad de un modelo.
En una prueba del mundo real, OpenAI apuntó GPT-Red a una máquina expendedora basada en IA construida por Andon Labs. Después de practicar en simulación, el modelo apuntó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 dólares, pedir un nuevo artículo de 100 dólares por esa misma cantidad y cancelar el pedido de otro cliente. Tras una divulgación responsable, se están probando nuevas salvaguardias, añadió.
Un segundo estudio de caso involucró el uso de GPT-Red para atacar a un agente de línea de comandos del Codex, basado en GPT-5.4 mini, en 10 tareas de exfiltración de datos retenidas, lo que provocó que se transmitieran datos confidenciales en más casos que una línea de base solicitada por GPT-5.5.
Una versión inicial del modelo también ha descubierto una nueva clase de ataques de inyección rápida directa conocidos como ataques de cadena de pensamiento (CoT) falsos, que lograron tasas de éxito superiores al 95 % en GPT-5.1, pero ahora están por debajo del 10 % para GPT-5.6 Sol.
«De manera similar, varios de nuestros puntos de referencia de inyección rápida indirecta que apuntan a ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)», dijo OpenAI.
«La robustez del propio GPT-Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de los ataques de GPT-Red han disminuido monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT-5.6 Sol falla en solo el 0,05% de las inyecciones directas de GPT-Red».
La divulgación se produce cuando la empresa dicho una auditoría de SWE-Bench Pro encontró que alrededor del 30% de las tareas están rotas, retractándose de su recomendación anterior de adoptar la punto de referencia para medir las capacidades de codificación de fronteras. A principios de febrero, OpenAI dicho se estaba alejando de SWE-bench Verificado debido a problemas fundamentales de diseño y contaminación.
«Encontramos evidencia de problemas críticos en una parte significativa del conjunto de datos», dijo OpenAI. «Nuestro proceso de análisis de puntos de datos detectó 200 (27,4%) tareas fallidas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de puntos de referencia que sean difíciles de jugar, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo».





