Un nuevo informe del Reino Unido descubre que los modelos de IA engañan y engañan constantemente a los usuarios

Las empresas fronterizas de IA a menudo se refieren a sus modelos como “asistentes útiles” o intentan compararlos con empleados de nivel inicial.

pero nuevo investigación del Instituto de Seguridad de IA del Reino Unido refuerza cómo los grandes modelos de lenguaje sufren de un defecto común que pondría a muchos empleados humanos en problemas con sus empleadores: hacen trampa.

En otras palabras, estos modelos están tan comprometidos a completar sus tareas que romperán las reglas, tomarán atajos y engañarán a sus propios usuarios para lograrlas.

«Todos los modelos que hemos probado para detectar este comportamiento intentaron hacer trampa», dice el informe de AISI.
«Los modelos no informaron de manera confiable este comportamiento cuando se les preguntó y, a menudo, no razonaron al respecto en su cadena de pensamiento, lo que sugiere que detectar trampas probablemente requerirá métodos de monitoreo sólidos».

La investigación probó los modelos ChatGPT 5.4, 5.5 y 5.6 de OpenAI, junto con Claude Opus 4.7 y Mythos Preview de Anthropic.

Se probaron modelos de IA de Anthropic y OpenAI para detectar trampas. Todos demostraron algún nivel de engaño en sus pruebas. (Fuente de la imagen: AISI)

El AISI ejecutó modelos a través de una serie de evaluaciones cibernéticas de «Capturar la bandera», donde obtuvieron puntos al realizar tareas ofensivas relacionadas con la ciberseguridad, como explotar una vulnerabilidad particular o realizar ingeniería inversa en el código compilado.

La investigación define «hacer trampa» como «realizar una acción que está fuera del alcance de la tarea o explícitamente no permitida por las reglas, con el fin de lograr un objetivo a través de un atajo, una solución alternativa o una solución no intencionada que la tarea no estaba destinada o no debería permitir».

Capta una variedad de comportamientos observados en los modelos, como buscar soluciones en Internet, atacar o escalar privilegios en sistemas no relacionados, probar software de evaluación para obtener acceso a la solución de la tarea.

Los modelos de IA no logran identificar cuándo están haciendo trampa y, a menudo, lo justifican como aceptable cuando los usuarios los cuestionan (Fuente de la imagen: AISI)

Los modelos tampoco reconocieron cuándo estaban haciendo trampa para completar una tarea, y menos del 50 por ciento dijo que romper las reglas era «incorrecto» cuando un usuario los cuestionó.

La propensión de un modelo a hacer trampa no estaba relacionada con su capacidad, lo que significa que los modelos más nuevos o avanzados no tienen más probabilidades de hacer trampa. Más bien, los investigadores creen que la culpa se debe a las técnicas utilizadas durante el entrenamiento y la alineación de un modelo.

Pero incluso si las tasas de trampa se mantienen constantes, el problema podría empeorar con el tiempo. A medida que los modelos más nuevos en el futuro podrían volverse más competentes y aprender técnicas de trampa más efectivas.

Este engaño también dificulta que laboratorios como AISI verifiquen su propio trabajo, que se basa en la evaluación de resultados confiables de los sistemas de inteligencia artificial.

Modelos como Claude Mythos Preview y GPT-5.6 Sol justifican sus trampas ante los usuarios. (Fuente de la imagen: AISI)

La investigación subraya cómo los sistemas de inteligencia artificial pueden hacer todo lo posible para completar su tarea, incluido eludir o burlar las protecciones de TI y ciberseguridad de una empresa.

En un caso, los investigadores de AISI dijeron que a un modelo se le dio inadvertidamente una evaluación de capacidad cibernética que estaba mal configurada y era imposible de resolver.

«El modelo probado fue tan persistente en el intento de hacer trampa que escribió y ejecutó código en un servicio externo, alojado en Internet abierto fuera de los sistemas de AISI, en un intento de acceder a nuestra infraestructura de evaluación, lo que provocó una alerta de seguridad en los sistemas de AISI», dice el informe.

Si bien AISI dijo que no hubo fugas de datos ni daños por el incidente, el modelo podría haber accedido con éxito a su sistema de evaluación si no hubieran contado con un monitoreo. El instituto dijo que implementó más controles en los sistemas internos en respuesta a la prueba.

Los investigadores dijeron que hay «consecuencias significativas» en un status quo en el que no podemos confiar en que los modelos no hagan trampa. Los comportamientos son especialmente problemáticos en áreas como la investigación de seguridad de la IA, así como las operaciones cibernéticas y toma de decisiones militaresdonde los resultados de confianza de los sistemas de IA son fundamentales.

Hoy, AISI dice que puede detectar trampas en LLM mediante una combinación de revisión manual y monitoreo de LLM, pero eso puede no ser siempre cierto, y los modelos futuros pueden ser mejores para ocultar sus acciones a los supervisores humanos.

«Una solución más fundamental sería entrenar a los modelos para que no hagan trampa en primer lugar, pero dado que este tipo de comportamiento se informó en modelos de frontera hace más de un año, alinearlo firmemente puede no ser fácil», escribieron los investigadores.

Derek B. Johnson

Escrito por Derek B. Johnson

Derek B. Johnson es reportero de CyberScoop, donde su área incluye la ciberseguridad, las elecciones y el gobierno federal. Antes de eso, ha brindado una cobertura galardonada de noticias sobre ciberseguridad en los sectores público y privado para varias publicaciones desde 2017. Derek tiene una licenciatura en periodismo impreso de la Universidad de Hofstra en Nueva York y una maestría en políticas públicas de la Universidad George Mason en Virginia.

El análisis de 216 millones de hallazgos de seguridad muestra un aumento de 4 veces en el riesgo crítico (informe de 2026) – CYBERDEFENSA.MX

OX Seguridad recientemente analizó 216 millones de hallazgos de seguridad en 250 organizaciones durante un período de 90 días. La conclusión principal: si bien el volumen de alertas brutas creció un 52 % año tras año, el riesgo crítico priorizado creció casi un 400 %.

El aumento del desarrollo asistido por IA está creando una «brecha de velocidad» en la que la densidad de vulnerabilidades de alto impacto aumenta más rápido que los flujos de trabajo de remediación. La proporción de hallazgos críticos y alertas sin procesar casi se triplicó, pasando del 0,035% al ​​0,092%.

Hallazgos clave del análisis de 2026:

  • CVSS versus contexto empresarial: Las puntuaciones de gravedad técnica ya no son el principal factor de riesgo. Los factores de elevación más comunes fueron Alta prioridad empresarial (27,76%) y Procesamiento de IIP (22,08%). En ambientes modernos, dónde una persona vulnerable vive ahora es más importante que qué la vulnerabilidad es.
  • La huella digital de la IA: Observamos una correlación directa entre la adopción de herramientas de codificación de IA y la cuadruplicación de hallazgos críticos (con un promedio de 795 por organización, frente a 202). El aumento de la velocidad del código está generando fallas más complejas y dependientes del contexto que evitan el linting básico y los escáneres heredados.
  • Variación del sector: Los perfiles de riesgo no son uniformes. Seguro Las empresas mostraron la mayor densidad de hallazgos críticos (1,76%), mientras que las Automotor El sector generó el mayor volumen bruto de alertas, probablemente debido a la escala masiva de expansión de la base de código en vehículos definidos por software.

Este es el segundo año que OX realiza este análisis para comparar el estado de la seguridad de las aplicaciones.

Informe completo, que incluye metodología y puntos de referencia específicos de la industria. está disponible aquí.

¿Encontró interesante este artículo? Este artículo es una contribución de uno de nuestros valiosos socios. Síguenos en noticias de google, Gorjeo y LinkedIn para leer más contenido exclusivo que publicamos.

Los atacantes están explotando la IA más rápido de lo que los defensores pueden seguir el ritmo, advierte un nuevo informe

La ciberseguridad está entrando en “una nueva fase” a medida que las herramientas de inteligencia artificial han madurado y han dado a los defensores de TI mucho menos tiempo para responder a los ciberataques y otras amenazas, según un nuevo informe publicado el lunes.

El informeescrito por el contratista federal Booz Allen Hamilton, concluye que los actores de amenazas han adoptado la IA más rápidamente que los gobiernos y las empresas privadas la adoptaron para la ciberdefensa.

Señala múltiples incidentes en los últimos dos años, como ataques llevados a cabo con la ayuda de Claude de Anthropic, que muestran que tanto los ciberdelincuentes como los grupos de piratería patrocinados por el estado se están moviendo y escalando más rápido que nunca.

Brad Medairy, vicepresidente ejecutivo y líder de la práctica de negocios cibernéticos de Booz Allen, dijo a CyberScoop que una de las mayores ventajas que los LLM han brindado a los atacantes es la capacidad de identificar lugares donde las ventanas están «ligeramente abiertas» (debilidades oscuras en un sistema como una vulnerabilidad perimetral) y luego usar rápidamente un exploit para establecer persistencia.

«Si tienes una vulnerabilidad en tu perímetro y el adversario se mete dentro del muro, en ese momento se moverá a la velocidad de la máquina», dijo.

El informe de Booz Allen sostiene que la mayoría de las operaciones defensivas de ciberseguridad, por el contrario, todavía dependen de procesos más lentos y orientados a los humanos que pueden tener dificultades para mantener ese ritmo más rápido.

Por ejemplo, cuando la Agencia de Seguridad de Infraestructura y Ciberseguridad agrega un CVE a su lista de vulnerabilidades explotadas conocidas, los defensores tienen plazos de 15 días para implementar un parche. Eso sería insuficiente para algo como HexStrike, un marco de seguridad de inteligencia artificial de código abierto popular entre los ciberdelincuentes que explotó “miles” de productos Citrix Netscaler en menos de 10 minutos utilizando un único CVE crítico.

Booz Allen Hamilton vende herramientas de ciberseguridad de IA, pero las conclusiones principales del informe coinciden con lo que dicen otros expertos en ciberseguridad independientes y externos, a saber, que los grandes modelos lingüísticos han sido de gran ayuda para los ciberdelincuentes y los Estados-nación.

El informe describe dos modelos generales que tienen los actores maliciosos para utilizar la IA.

En uno, se convierte en un amplificador para sus operaciones de piratería individuales. Este enfoque utiliza LLM para agregar velocidad y escala a lo que los piratas informáticos ya están haciendo, mientras mantiene al ser humano informado sobre las decisiones clave. Con este enfoque, «un solo operador que utilice herramientas agentes puede ejecutar acciones de reconocimiento, explotación y seguimiento en docenas de objetivos a la vez».

El otro modelo, llamado “orquestación”, se parece más a la codificación de vibraciones, conectando el LLM a herramientas de seguridad ofensivas, apuntándolo a un objetivo y estableciendo los límites y parámetros del agente.

Medairy dijo que es probable que la regulación y las políticas en torno a la IA sigan rezagadas con respecto a su desarrollo, lo que obligará a los funcionarios de ciberseguridad a tomar decisiones difíciles sobre el cambio a defensas automatizadas y asistidas por IA para mantenerse al día. En este escenario, las organizaciones planificarían y ejecutarían ejercicios teóricos con anticipación para determinar cómo sus agentes de IA deberían responder a un ataque en curso, qué límites o parámetros establecer y qué activos priorizar.

Pero existen riesgos reales al traspasar funciones cibernéticas o de TI críticas a un sistema de inteligencia artificial. Amazon tiene tratado con múltiples interrupciones relacionadas con cambios de software realizados de forma automatizada a través de IA, y recientemente requirió que sus ingenieros senior aprobaran personalmente cualquier cambio de código asistido por IA.

Medairy reconoció los riesgos, pero señaló que “el adversario obtiene un voto” y ya ha tomado medidas para explotar los sistemas de inteligencia artificial para la seguridad ofensiva, por lo que los defensores tendrán que reevaluar cómo es la “tolerancia aceptable al riesgo” cuando se trata de defensa a la velocidad de la máquina.

«Creo que nos veremos obligados a salir de nuestra zona de confort y realmente adoptar parte de esta remediación más automatizada mucho más rápido de lo que probablemente nos sentimos cómodos», dijo.

Derek B. Johnson

Escrito por Derek B. Johnson

Derek B. Johnson es reportero de CyberScoop, donde su área incluye la ciberseguridad, las elecciones y el gobierno federal. Antes de eso, ha brindado una cobertura galardonada de noticias sobre ciberseguridad en los sectores público y privado para varias publicaciones desde 2017. Derek tiene una licenciatura en periodismo impreso de la Universidad de Hofstra en Nueva York y una maestría en políticas públicas de la Universidad George Mason en Virginia.