{"id":1664,"date":"2026-07-21T19:50:00","date_gmt":"2026-07-21T19:50:00","guid":{"rendered":"https:\/\/cybercolombia.co\/index.php\/2026\/07\/21\/un-nuevo-informe-del-reino-unido-descubre-que-los-modelos-de-ia-enganan-y-enganan-constantemente-a-los-usuarios\/"},"modified":"2026-07-21T19:50:00","modified_gmt":"2026-07-21T19:50:00","slug":"un-nuevo-informe-del-reino-unido-descubre-que-los-modelos-de-ia-enganan-y-enganan-constantemente-a-los-usuarios","status":"publish","type":"post","link":"https:\/\/cybercolombia.co\/index.php\/2026\/07\/21\/un-nuevo-informe-del-reino-unido-descubre-que-los-modelos-de-ia-enganan-y-enganan-constantemente-a-los-usuarios\/","title":{"rendered":"Un nuevo informe del Reino Unido descubre que los modelos de IA enga\u00f1an y enga\u00f1an constantemente a los usuarios"},"content":{"rendered":"<div>\n<p>Las empresas fronterizas de IA a menudo se refieren a sus modelos como \u201casistentes \u00fatiles\u201d o intentan compararlos con empleados de nivel inicial.  <\/p>\n<p>pero nuevo <a href=\"https:\/\/www.aisi.gov.uk\/blog\/cheating-behaviour-in-frontier-model-evaluations\">investigaci\u00f3n<\/a> del Instituto de Seguridad de IA del Reino Unido refuerza c\u00f3mo los grandes modelos de lenguaje sufren de un defecto com\u00fan que pondr\u00eda a muchos empleados humanos en problemas con sus empleadores: hacen trampa.<\/p>\n<p>En otras palabras, estos modelos est\u00e1n tan comprometidos a completar sus tareas que romper\u00e1n las reglas, tomar\u00e1n atajos y enga\u00f1ar\u00e1n a sus propios usuarios para lograrlas.<\/p>\n<p>\u00abTodos los modelos que hemos probado para detectar este comportamiento intentaron hacer trampa\u00bb, dice el informe de AISI.<br \/>\u00abLos modelos no informaron de manera confiable este comportamiento cuando se les pregunt\u00f3 y, a menudo, no razonaron al respecto en su cadena de pensamiento, lo que sugiere que detectar trampas probablemente requerir\u00e1 m\u00e9todos de monitoreo s\u00f3lidos\u00bb.<\/p>\n<p>La investigaci\u00f3n prob\u00f3 los modelos ChatGPT 5.4, 5.5 y 5.6 de OpenAI, junto con Claude Opus 4.7 y Mythos Preview de Anthropic.<\/p>\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" height=\"443\" width=\"1024\" src=\"https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png?w=1024\" alt=\"\" class=\"wp-image-89903\" srcset=\"https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png 1392w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png?resize=300,130 300w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png?resize=768,332 768w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png?resize=1024,443 1024w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png?resize=600,259 600w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_476eac.png?resize=1200,519 1200w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\"\/><figcaption class=\"wp-element-caption\">Se probaron modelos de IA de Anthropic y OpenAI para detectar trampas. Todos demostraron alg\u00fan nivel de enga\u00f1o en sus pruebas. (Fuente de la imagen: AISI)<\/figcaption><\/figure>\n<p>El AISI ejecut\u00f3 modelos a trav\u00e9s de una serie de evaluaciones cibern\u00e9ticas de \u00abCapturar la bandera\u00bb, donde obtuvieron puntos al realizar tareas ofensivas relacionadas con la ciberseguridad, como explotar una vulnerabilidad particular o realizar ingenier\u00eda inversa en el c\u00f3digo compilado.<\/p>\n<p>La investigaci\u00f3n define \u00abhacer trampa\u00bb como \u00abrealizar una acci\u00f3n que est\u00e1 fuera del alcance de la tarea o expl\u00edcitamente no permitida por las reglas, con el fin de lograr un objetivo a trav\u00e9s de un atajo, una soluci\u00f3n alternativa o una soluci\u00f3n no intencionada que la tarea no estaba destinada o no deber\u00eda permitir\u00bb.<\/p>\n<p>Capta una variedad de comportamientos observados en los modelos, como buscar soluciones en Internet, atacar o escalar privilegios en sistemas no relacionados, probar software de evaluaci\u00f3n para obtener acceso a la soluci\u00f3n de la tarea.<\/p>\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" height=\"413\" width=\"1024\" src=\"https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png?w=1024\" alt=\"\" class=\"wp-image-89904\" srcset=\"https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png 1388w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png?resize=300,121 300w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png?resize=768,310 768w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png?resize=1024,413 1024w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png?resize=600,242 600w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_8e1fcd.png?resize=1200,484 1200w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\"\/><figcaption class=\"wp-element-caption\">Los modelos de IA no logran identificar cu\u00e1ndo est\u00e1n haciendo trampa y, a menudo, lo justifican como aceptable cuando los usuarios los cuestionan (Fuente de la imagen: AISI)<\/figcaption><\/figure>\n<p>Los modelos tampoco reconocieron cu\u00e1ndo estaban haciendo trampa para completar una tarea, y menos del 50 por ciento dijo que romper las reglas era \u00abincorrecto\u00bb cuando un usuario los cuestion\u00f3.<\/p>\n<p>La propensi\u00f3n de un modelo a hacer trampa no estaba relacionada con su capacidad, lo que significa que los modelos m\u00e1s nuevos o avanzados no tienen m\u00e1s probabilidades de hacer trampa. M\u00e1s bien, los investigadores creen que la culpa se debe a las t\u00e9cnicas utilizadas durante el entrenamiento y la alineaci\u00f3n de un modelo.<\/p>\n<p>Pero incluso si las tasas de trampa se mantienen constantes, el problema podr\u00eda empeorar con el tiempo. A medida que los modelos m\u00e1s nuevos en el futuro podr\u00edan volverse m\u00e1s competentes y aprender t\u00e9cnicas de trampa m\u00e1s efectivas.<\/p>\n<p>Este enga\u00f1o tambi\u00e9n dificulta que laboratorios como AISI verifiquen su propio trabajo, que se basa en la evaluaci\u00f3n de resultados confiables de los sistemas de inteligencia artificial.<\/p>\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" height=\"455\" width=\"1024\" src=\"https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png?w=1024\" alt=\"\" class=\"wp-image-89905\" srcset=\"https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png 1376w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png?resize=300,133 300w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png?resize=768,342 768w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png?resize=1024,455 1024w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png?resize=600,267 600w, https:\/\/cyberscoop.com\/wp-content\/uploads\/sites\/3\/2026\/07\/image_db1ab3.png?resize=1200,534 1200w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\"\/><figcaption class=\"wp-element-caption\">Modelos como Claude Mythos Preview y GPT-5.6 Sol justifican sus trampas ante los usuarios. (Fuente de la imagen: AISI)<\/figcaption><\/figure>\n<p>La investigaci\u00f3n subraya c\u00f3mo los sistemas de inteligencia artificial pueden hacer todo lo posible para completar su tarea, incluido eludir o burlar las protecciones de TI y ciberseguridad de una empresa.<\/p>\n<p>En un caso, los investigadores de AISI dijeron que a un modelo se le dio inadvertidamente una evaluaci\u00f3n de capacidad cibern\u00e9tica que estaba mal configurada y era imposible de resolver.<\/p>\n<p>\u00abEl modelo probado fue tan persistente en el intento de hacer trampa que escribi\u00f3 y ejecut\u00f3 c\u00f3digo en un servicio externo, alojado en Internet abierto fuera de los sistemas de AISI, en un intento de acceder a nuestra infraestructura de evaluaci\u00f3n, lo que provoc\u00f3 una alerta de seguridad en los sistemas de AISI\u00bb, dice el informe.<\/p>\n<p>Si bien AISI dijo que no hubo fugas de datos ni da\u00f1os por el incidente, el modelo podr\u00eda haber accedido con \u00e9xito a su sistema de evaluaci\u00f3n si no hubieran contado con un monitoreo. El instituto dijo que implement\u00f3 m\u00e1s controles en los sistemas internos en respuesta a la prueba.<\/p>\n<p>Los investigadores dijeron que hay \u00abconsecuencias significativas\u00bb en un status quo en el que no podemos confiar en que los modelos no hagan trampa. Los comportamientos son especialmente problem\u00e1ticos en \u00e1reas como la investigaci\u00f3n de seguridad de la IA, as\u00ed como las operaciones cibern\u00e9ticas y <a href=\"https:\/\/defensescoop.com\/2026\/06\/30\/trump-administration-announces-war-force-effort\/\">toma de decisiones militares<\/a>donde los resultados de confianza de los sistemas de IA son fundamentales.<\/p>\n<p>Hoy, AISI dice que puede detectar trampas en LLM mediante una combinaci\u00f3n de revisi\u00f3n manual y monitoreo de LLM, pero eso puede no ser siempre cierto, y los modelos futuros pueden ser mejores para ocultar sus acciones a los supervisores humanos.<\/p>\n<p>\u00abUna soluci\u00f3n m\u00e1s fundamental ser\u00eda entrenar a los modelos para que no hagan trampa en primer lugar, pero dado que este tipo de comportamiento se inform\u00f3 en modelos de frontera hace m\u00e1s de un a\u00f1o, alinearlo firmemente puede no ser f\u00e1cil\u00bb, escribieron los investigadores.<\/p>\n<footer class=\"single-article__footer\">\n<div class=\"author-card\">\n<div class=\"author-card__avatar\">\n<figure class=\"author-card__image-wrap\">\n\t\t\t\t\t<img decoding=\"async\" class=\"author-card__image\" src=\"http:\/\/2.gravatar.com\/avatar\/ea8b076b398ee48b71cfaecf898c582b?s=192&amp;d=mm&amp;r=g\" alt=\"Derek B. Johnson\"\/><br \/>\n\t\t\t\t<\/figure>\n<\/p><\/div>\n<p><h4 class=\"author-card__name\">Escrito por Derek B. Johnson<\/h4>\n<p>\t\t\tDerek B. Johnson es reportero de CyberScoop, donde su \u00e1rea incluye la ciberseguridad, las elecciones y el gobierno federal. Antes de eso, ha brindado una cobertura galardonada de noticias sobre ciberseguridad en los sectores p\u00fablico y privado para varias publicaciones desde 2017. Derek tiene una licenciatura en periodismo impreso de la Universidad de Hofstra en Nueva York y una maestr\u00eda en pol\u00edticas p\u00fablicas de la Universidad George Mason en Virginia.\t\t<\/p>\n<\/p><\/div>\n<\/footer><\/div>\n","protected":false},"excerpt":{"rendered":"<p>Las empresas fronterizas de IA a menudo se refieren a sus modelos como \u201casistentes \u00fatiles\u201d o intentan compararlos con empleados de nivel inicial. pero nuevo investigaci\u00f3n del Instituto de Seguridad de IA del Reino Unido refuerza c\u00f3mo los grandes modelos de lenguaje sufren de un defecto com\u00fan que pondr\u00eda a muchos empleados humanos en problemas [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":1665,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[2],"tags":[1708,70,2955,775,903,52,2993,169,1772,1773,1115],"class_list":["post-1664","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-latest","tag-constantemente","tag-del","tag-descubre","tag-enganan","tag-informe","tag-los","tag-modelos","tag-nuevo","tag-reino","tag-unido","tag-usuarios"],"_links":{"self":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts\/1664","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/comments?post=1664"}],"version-history":[{"count":0,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts\/1664\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/media\/1665"}],"wp:attachment":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/media?parent=1664"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/categories?post=1664"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/tags?post=1664"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}