{"id":1598,"date":"2026-07-16T10:28:14","date_gmt":"2026-07-16T10:28:14","guid":{"rendered":"https:\/\/cybercolombia.co\/index.php\/2026\/07\/16\/gpt-red-de-openai-automatiza-las-pruebas-de-inyeccion-rapidas-para-endurecer-el-sol-gpt-5-6-cyberdefensa-mx\/"},"modified":"2026-07-16T10:28:14","modified_gmt":"2026-07-16T10:28:14","slug":"gpt-red-de-openai-automatiza-las-pruebas-de-inyeccion-rapidas-para-endurecer-el-sol-gpt-5-6-cyberdefensa-mx","status":"publish","type":"post","link":"https:\/\/cybercolombia.co\/index.php\/2026\/07\/16\/gpt-red-de-openai-automatiza-las-pruebas-de-inyeccion-rapidas-para-endurecer-el-sol-gpt-5-6-cyberdefensa-mx\/","title":{"rendered":"GPT-Red de OpenAI automatiza las pruebas de inyecci\u00f3n r\u00e1pidas para endurecer el sol GPT-5.6 \u2013 CYBERDEFENSA.MX"},"content":{"rendered":"<div id=\"articlebody\">\n<p>OpenAI ha revelado detalles de <strong>GPT-Rojo<\/strong>un modelo interno automatizado de equipo rojo que escala el descubrimiento r\u00e1pido de vulnerabilidades de inyecci\u00f3n con el objetivo de solucionar problemas antes de que las herramientas se implementen ampliamente.<\/p>\n<p>\u00abGPT-Red es un equipo rojo fuerte y nuestros modelos anteriores son muy vulnerables a sus r\u00e1pidos ataques de inyecci\u00f3n\u00bb, la empresa de inteligencia artificial (IA) <a href=\"https:\/\/openai.com\/index\/unlocking-self-improvement-gpt-red\/\" target=\"_blank\">dicho<\/a>. \u00abUtilizamos GPT-Red para entrenar adversariamente a GPT-5.6, haci\u00e9ndolo mucho m\u00e1s robusto para provocar inyecciones\u00bb.<\/p>\n<p>El modelo funciona igual que un miembro del equipo rojo humano. Env\u00eda un mensaje, monitorea c\u00f3mo responde un modelo GPT y recorre su camino hacia un objetivo malicioso, como cargar datos confidenciales a un servidor externo.<\/p>\n<p>Este avance se produce cuando las inyecciones r\u00e1pidas adversas siguen siendo una espina persistente en la carne de los grandes modelos de lenguaje, a los que se puede enga\u00f1ar para que ejecuten una instrucci\u00f3n cuidadosamente elaborada\u2060 que puede producir consecuencias indeseables.<\/p>\n<p>A medida que los sistemas agentes contin\u00faan vinculados a fuentes de datos de terceros a trav\u00e9s de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, tambi\u00e9n han ampliado la superficie de ataque y presentado m\u00e1s v\u00edas para que los malos actores influyan en el resultado de un modelo al incorporar mensajes maliciosos dentro de contenido aparentemente inofensivo que se alimenta como entrada. Esto puede tomar la forma de un correo electr\u00f3nico, una p\u00e1gina web, una respuesta de herramienta o un repositorio de c\u00f3digo.<\/p>\n<div class=\"dog_two clear\">\n<div class=\"cf\"><a href=\"https:\/\/thehackernews.uk\/ai-vuln-protection-d\" rel=\"nofollow noopener sponsored\" target=\"_blank\"><img loading=\"lazy\" decoding=\"async\" class=\"lazyload\" alt=\"Ciberseguridad\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEjQl2axNwsfhbXOFynrg_uAZsvHi3OvNGSA8KJO-BKR8Xm3x7yjKV3EvfY4v5mwXx6LF0uWFb9h9d9iAV_Pi-YYhqimX9wx4OaLdDJEdR215Xrxq_PAtXkaLfQso4pTSjbj6fvh_ZTliLpzWZSZfcoZgyXtKwhN-SSDDlmbtUqGLshc0KqYQGWYHMN52Sl1\/s728-e100\/zz-d.jpg\" width=\"729\" height=\"91\"\/><\/a><\/div>\n<\/div>\n<p>GPT-Red tiene como objetivo aumentar el equipo rojo humano a escala, haciendo posible identificar nuevos modos de falla, mejorar la solidez y construir contramedidas adecuadas antes de que se puedan implementar los modelos.<\/p>\n<p>\u00abDe manera similar a c\u00f3mo los miembros del equipo rojo humano elaboran ataques, el modelo trabaja hacia un objetivo enviando un mensaje, observando c\u00f3mo responden los modelos GPT e iterando\u00bb, dijo OpenAI.<\/p>\n<p>Al integrar directamente GPT-Red en el proceso de capacitaci\u00f3n de sus modelos de producci\u00f3n, OpenAI dijo que GPT-5.6 Sol es su modelo m\u00e1s robusto para inyecciones inmediatas hasta la fecha, logrando 6 veces menos fallas en comparaci\u00f3n con el punto de referencia de inyecci\u00f3n directa directa en comparaci\u00f3n con GPT-5.5, su modelo de frontera de cuatro meses antes.<\/p>\n<div class=\"separator\" style=\"clear: both;\"><a href=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEivR05qGYflfJbkjKovoqk4ZWK4JthR1lMmAa29yIvHCz56vPaWJ9a2WksPe9WywWhD0QO9hXO7PYEGCOtY7-un7KiVcqM89xcIDH4OjP-LgmlyD9izPMOTSAet5IIN9EMHiH41vZ9R9g3WPxl7XsXys5hjDIymrWANkv4YnZ4atQgEnwNjRqi1SeSrSMIP\/s1700-e365\/gpt-red.jpg\" style=\"display: block;  text-align: center; clear: left; float: left;\"><img decoding=\"async\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEivR05qGYflfJbkjKovoqk4ZWK4JthR1lMmAa29yIvHCz56vPaWJ9a2WksPe9WywWhD0QO9hXO7PYEGCOtY7-un7KiVcqM89xcIDH4OjP-LgmlyD9izPMOTSAet5IIN9EMHiH41vZ9R9g3WPxl7XsXys5hjDIymrWANkv4YnZ4atQgEnwNjRqi1SeSrSMIP\/s1700-e365\/gpt-red.jpg\" alt=\"\" border=\"0\" data-original-height=\"667\" data-original-width=\"970\"\/><\/a><\/div>\n<p>Algunos de los ejemplos de conversaciones inyectadas con indicaciones probadas como parte del proceso incluyen:<\/p>\n<ul>\n<li>Exfiltraci\u00f3n de directorio interno<\/li>\n<li>Instrucciones de pago fraudulentas<\/li>\n<li>Exfiltraci\u00f3n de credenciales de Amazon Web Services (AWS)<\/li>\n<li>Deshabilitar la autenticaci\u00f3n de dos factores (2FA)<\/li>\n<li>Carga del archivo de credenciales<\/li>\n<li>Inyecci\u00f3n de script externo<\/li>\n<li>Reenv\u00edo de claves API<\/li>\n<li>Scripts de raspado maliciosos<\/li>\n<\/ul>\n<p>\u00abGPT-Red se entrena mediante el aprendizaje por refuerzo de juego aut\u00f3nomo, donde el modelo y una colecci\u00f3n de diversos LLM defensores se entrenan simult\u00e1neamente en un amplio conjunto de escenarios de equipos rojos\u00bb, explic\u00f3 OpenAI. \u00abGPT-Red es recompensado por provocar un fallo v\u00e1lido, como una inyecci\u00f3n r\u00e1pida exitosa, mientras que los modelos defensores son recompensados \u200b\u200bpor resistir el ataque y completar sus tareas originales\u00bb.<\/p>\n<p>Esto tambi\u00e9n significa que a medida que los modelos defensores se vuelvan m\u00e1s robustos, el modelo de equipo rojo tendr\u00e1 que volver a la mesa de dibujo para descubrir m\u00e9todos de ataque m\u00e1s potentes y diversos para derrotar esas barreras. Espec\u00edficamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT-5.1 en m\u00e1s escenarios que los equipos rojos humanos cuando se trata de inyecciones r\u00e1pidas indirectas.<\/p>\n<div class=\"separator\" style=\"clear: both;\"><a href=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEh369u12EmTraMOV131e8ErS5pZFQUWFulxgg22Ad4rR0dQFjL6oAGb1dIGNMoer0ULW08HrEVfnVg-bPEhVZbhzDTLzNWer4bLteKPhtIdwpDw45W4GDxUSgbfSOBQMcyxm4uJxWumhIAwdY3bTrWI16GY0gTXCkIUk9G1xAz5Afs7PBrqy9YKOBI8UjMS\/s1700-e365\/open-2.jpg\" style=\"display: block;  text-align: center; clear: left; float: left;\"><img decoding=\"async\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEh369u12EmTraMOV131e8ErS5pZFQUWFulxgg22Ad4rR0dQFjL6oAGb1dIGNMoer0ULW08HrEVfnVg-bPEhVZbhzDTLzNWer4bLteKPhtIdwpDw45W4GDxUSgbfSOBQMcyxm4uJxWumhIAwdY3bTrWI16GY0gTXCkIUk9G1xAz5Afs7PBrqy9YKOBI8UjMS\/s1700-e365\/open-2.jpg\" alt=\"\" border=\"0\" data-original-height=\"651\" data-original-width=\"1197\"\/><\/a><\/div>\n<p>OpenAI adem\u00e1s destac\u00f3 que GPT-Red se mantiene separado de los otros modelos para que las capacidades maliciosas incorporadas no lleguen a los malos actores que buscan constantemente varias formas de eludir las medidas \u00e9ticas y de seguridad de un modelo.<\/p>\n<p>En una prueba del mundo real, OpenAI apunt\u00f3 GPT-Red a una m\u00e1quina expendedora basada en IA construida por Andon Labs. Despu\u00e9s de practicar en simulaci\u00f3n, el modelo apunt\u00f3 al agente aut\u00f3nomo y cumpli\u00f3 sus tres objetivos: reducir el precio de un art\u00edculo caro al precio m\u00ednimo permitido de 0,50 d\u00f3lares, pedir un nuevo art\u00edculo de 100 d\u00f3lares por esa misma cantidad y cancelar el pedido de otro cliente. Tras una divulgaci\u00f3n responsable, se est\u00e1n probando nuevas salvaguardias, a\u00f1adi\u00f3.<\/p>\n<div class=\"dog_two clear\">\n<div class=\"cf\"><a href=\"https:\/\/thehackernews.uk\/sygnia-cyber-response-d-2\" rel=\"nofollow noopener sponsored\" target=\"_blank\"><img loading=\"lazy\" decoding=\"async\" class=\"lazyload\" alt=\"Ciberseguridad\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEjHcvlLVmAqlffm6kG54_0cGVf8WfcgzqT9B0fBSizSSeIjh8tBepXnrf6BMqKiG344WgqNejcRtEFKT1PmOzQNQBhdmu2iz9Po10z0SSDlFuZ37iip2uYibJDoxTEkbUI7Bx8NJM2Io_z_nl5p4YA-ZhqFLfi0GW1axyu-lQx-iytCn9RGSJ2iqCwdyv8m\/s1600\/sy-d-2.jpg\" width=\"729\" height=\"91\"\/><\/a><\/div>\n<\/div>\n<p>Un segundo estudio de caso involucr\u00f3 el uso de GPT-Red para atacar a un agente de l\u00ednea de comandos del Codex, basado en GPT-5.4 mini, en 10 tareas de exfiltraci\u00f3n de datos retenidas, lo que provoc\u00f3 que se transmitieran datos confidenciales en m\u00e1s casos que una l\u00ednea de base solicitada por GPT-5.5.<\/p>\n<p>Una versi\u00f3n inicial del modelo tambi\u00e9n ha descubierto una nueva clase de ataques de inyecci\u00f3n r\u00e1pida directa conocidos como ataques de cadena de pensamiento (CoT) falsos, que lograron tasas de \u00e9xito superiores al 95 % en GPT-5.1, pero ahora est\u00e1n por debajo del 10 % para GPT-5.6 Sol.<\/p>\n<p>\u00abDe manera similar, varios de nuestros puntos de referencia de inyecci\u00f3n r\u00e1pida indirecta que apuntan a ataques en herramientas de desarrollo y navegaci\u00f3n han sido saturados por nuestro \u00faltimo modelo (&gt;97% de precisi\u00f3n)\u00bb, dijo OpenAI.<\/p>\n<p>\u00abLa robustez del propio GPT-Red tambi\u00e9n ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de \u00e9xito de los ataques de GPT-Red han disminuido mon\u00f3tonamente con el tiempo. Con el lanzamiento de nuestro \u00faltimo modelo, GPT-5.6 Sol falla en solo el 0,05% de las inyecciones directas de GPT-Red\u00bb.<\/p>\n<p>La divulgaci\u00f3n se produce cuando la empresa <a href=\"https:\/\/openai.com\/index\/separating-signal-from-noise-coding-evaluations\/\" target=\"_blank\">dicho<\/a> una auditor\u00eda de <a href=\"https:\/\/scale.com\/blog\/swe-bench-pro\" target=\"_blank\">SWE-Bench Pro<\/a> encontr\u00f3 que alrededor del 30% de las tareas est\u00e1n rotas, retract\u00e1ndose de su recomendaci\u00f3n anterior de adoptar la <a href=\"https:\/\/labs.scale.com\/leaderboard\/swe_bench_pro_public\" target=\"_blank\">punto de referencia<\/a> para medir las capacidades de codificaci\u00f3n de fronteras. A principios de febrero, OpenAI <a href=\"https:\/\/openai.com\/index\/why-we-no-longer-evaluate-swe-bench-verified\/\" target=\"_blank\">dicho<\/a> se estaba alejando de <a href=\"https:\/\/www.swebench.com\/verified.html\" target=\"_blank\">SWE-bench Verificado<\/a> debido a problemas fundamentales de dise\u00f1o y contaminaci\u00f3n.<\/p>\n<p>\u00abEncontramos evidencia de problemas cr\u00edticos en una parte significativa del conjunto de datos\u00bb, dijo OpenAI. \u00abNuestro proceso de an\u00e1lisis de puntos de datos detect\u00f3 200 (27,4%) tareas fallidas, mientras que la campa\u00f1a de anotaci\u00f3n humana identific\u00f3 249 (34,1%). En \u00faltima instancia, una evaluaci\u00f3n debe proporcionar una se\u00f1al significativa a trav\u00e9s de puntos de referencia que sean dif\u00edciles de jugar, f\u00e1ciles de confiar y que reflejen genuinamente la capacidad o alineaci\u00f3n del modelo\u00bb.<\/p>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>OpenAI ha revelado detalles de GPT-Rojoun modelo interno automatizado de equipo rojo que escala el descubrimiento r\u00e1pido de vulnerabilidades de inyecci\u00f3n con el objetivo de solucionar problemas antes de que las herramientas se implementen ampliamente. \u00abGPT-Red es un equipo rojo fuerte y nuestros modelos anteriores son muy vulnerables a sus r\u00e1pidos ataques de inyecci\u00f3n\u00bb, la [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":1379,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[25,5],"tags":[3819,24,811,3367,3818,626,95,600,36,1950,3820,3368],"class_list":["post-1598","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-noticias","category-trending","tag-automatiza","tag-cyberdefensa-mx","tag-endurecer","tag-gpt5-6","tag-gptred","tag-inyeccion","tag-las","tag-openai","tag-para","tag-pruebas","tag-rapidas","tag-sol"],"_links":{"self":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts\/1598","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/comments?post=1598"}],"version-history":[{"count":0,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts\/1598\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/media\/1379"}],"wp:attachment":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/media?parent=1598"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/categories?post=1598"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/tags?post=1598"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}