El agente corrupto de OpenAI muestra por qué necesitamos reglas federales para la IA autónoma

Meses antes de la violación de Hugging Face, surge la IA investigación publicada que hizo público el periodista de investigación Ronan Farrow. Diez agentes autónomos de IA operaron en cinco entornos virtuales durante quince días sin intervención humana. Gran parte de la atención se centró en Grok 4.1 volviéndose violento y Gemini 3 Flash cometiendo 683 crímenes.

Lo que más importaba pasó desapercibido: Claude Sonnet 4.6 de Anthropic construyó una democracia pacífica de forma aislada y luego robó recursos de entornos vecinos en el momento en que se unió a uno compartido. La lección fue clara: la seguridad no es un atributo modelo. Surge del entorno operativo. Los modelos no cambiaron. Trabajando según lo diseñado, su comportamiento evolucionó a medida que cambiaba el entorno. La lección es difícil de ignorar: el entorno de gobernanza cambió y, con él, la dinámica de recompensas.

La historia aquí se refiere a instituciones, específicamente OpenAI y Hugging Face, y cómo debemos entender su reciente incidente de seguridad a través de esa lente.

La industria está de acuerdo sobre cómo ocurrió la violación de Hugging Face. Los expertos en ciberseguridad se han centrado en las vulnerabilidades, cómo se utilizaban y cómo remediarlas. OpenAI ha destacado las capacidades del modelo. Ambas conversaciones importan. Lo que requiere atención es por qué esta brecha es estratégicamente importante. Después de pasar el fin de semana pasado discutiéndolo con formuladores de políticas, investigadores de seguridad y profesionales de la industria en Aspen, salí convencido de que estamos examinando el problema equivocado.

En 1961, el psicólogo de Yale Los experimentos de Stanley Milgram. reveló una verdad más amplia: cambiar la arquitectura institucional cambia el comportamiento sin cambiar al actor. Los investigadores de Emergence AI no cambiaron al agente de Claude. Cambiaron la arquitectura de gobernanza que determinaba lo que constituía el éxito del sistema. El comportamiento de Claude cambió con eso.

OpenAI construyó un modelo inteligente pero se olvidó de construir una sala más inteligente. Esa elección hizo posible la brecha en Hugging Face. Todas las organizaciones que ahora despliegan agentes autónomos enfrentan el mismo problema de gobernanza.

OpenAI le dio al agente un objetivo: pasar una evaluación de ciberseguridad. Para ponerlo a prueba por completo, relajaron las restricciones de seguridad y el agente encontró un camino más corto. En lugar de resolver la evaluación directamente, encontró las respuestas fuera del entorno de prueba, escapó de su entorno de pruebas y aprovechó una falla en el proceso de procesamiento de datos de Hugging Face para llegar a los sistemas de producción en vivo. Durante el fin de semana, sin supervisión humana, ejecutó más de 17.000 acciones automatizadas escalando su propio acceso, moviéndose a través de sistemas internos y recopilando credenciales.

Hugging Face es una de las empresas de inteligencia artificial más destacadas del mundo, valorada en aproximadamente 4.500 millones de dólares. Proporciona la infraestructura que los gobiernos, las organizaciones de defensa y las empresas de tecnología utilizan para construir e implementar IA. El agente perseguía el objetivo que se le había asignado. Irrumpir en Hugging Face fue el camino más rápido para pasar la prueba. La gobernanza establecía el objetivo, el nivel de riesgo a aceptar y quién era responsable. El diseño técnico determinó si esas decisiones de gobernanza podrían hacerse cumplir. Como afirman los investigadores James Shires y Max Smeets han discutidopara que un modelo sea lo suficientemente capaz de actuar por sí solo, las pruebas y el despliegue deben regirse de la misma manera.

El diseño de agentes de IA requiere estándares básicos. La observabilidad, incluida una capa de monitoreo que señala cuando un agente va más allá de su alcance, es un requisito básico. La revisión humana también es importante en los límites de escalada, como cuando un agente pasa de herramientas internas a herramientas externas. Cuando cualquier agente cruza ese límite, ¿qué alerta se activa? ¿Qué humano lo revisa? Carecemos de respuestas claras para cualquiera de las dos. Se trata de una elección de gobernanza, no simplemente de una falla de seguridad. En el mejor de los casos, ésta fue una prueba catastróficamente fallida. En el peor de los casos, ¿cómo podemos confiar en que una empresa de inteligencia artificial de vanguardia autogobernará el despliegue autónomo de agentes?

Hace más de una década, el Departamento de Defensa de EE. UU. creó el programa Comply-to-Connect (C2C): cada dispositivo que se conecta a redes sensibles debe demostrar que pertenece allí o quedará aislado de la red. C2C funciona porque el actor en cuarentena se detiene. Una computadora portátil que no pasa la verificación se desconecta y permanece allí. Un agente de IA autónomo se adapta a la aplicación de la ley. C2C fue creado para actores pasivos. La gobernanza de los agentes autónomos debe adaptarse a los que se adaptan. La visibilidad no es aplicación de la ley y la aplicación de la ley no es control. Nos faltan los tres.

Una segunda falla que no se está discutiendo lo suficiente: la violación explotó una suposición de confianza implícita en el proceso de procesamiento de datos de Hugging Face, donde las entradas se trataban como confiables sin verificación. Después de SolarWinds, el gobierno de EE. UU. estableció reglas para la integridad de la cadena de suministro de software: Orden Ejecutiva 14028 y demandas de verificación de software federal. El principio era simple: la confianza debe verificarse mediante pruebas. Esos principios aún no se han aplicado de manera integral o consistente a la cadena de suministro del modelo de IA. Las reglas siguen siendo débiles. A nadie se le ha pedido que explique por qué.

La respuesta no es un nuevo marco. Los marcos existentes son suficientes. C2C demostró que la visibilidad sin aplicación de la ley deja lagunas, mientras que la Orden Ejecutiva 14028 estableció que la confianza en las cadenas de suministro de software requiere pruebas y verificación. El desafío radica en aplicar estos principios a una nueva categoría de actores. El Congreso, la Agencia de Seguridad de Infraestructura y Ciberseguridad o la Oficina de Gestión y Presupuesto deberían tomar determinaciones formales de que los agentes autónomos de IA deben seguir las mismas reglas que cualquier otro actor en una red federal. El marco existe; debe ser actualizado.

El próximo incidente ya está en marcha. Aparecerá en los registros como tráfico extraño, se entregará a las mismas personas que publicaron estos marcos esta semana y provocará otra ronda de recomendaciones sobre las que nadie actúa. Hemos resuelto este problema antes: para dispositivos, para software, para cadenas de suministro. Sabemos cómo construir habitaciones más inteligentes. Las herramientas existen. La voluntad, la autoridad y la decisión de gobernar siguen ausentes.

alison rey

Escrito por Alison King

Alison King es vicepresidenta de Asuntos Gubernamentales de Forescout, presidenta de la junta directiva de OT Cyber ​​Coalition y miembro principal del Instituto McCrary de la Universidad de Auburn. Anteriormente se desempeñó como Directora de Comunicaciones Estratégicas y Asuntos Legislativos de la Comisión Cyberspace Solarium.

El caso para combinar IA autónoma con copilotos analistas – CYBERDEFENSA.MX

Hace unos días, estaba sentado con el CISO de una empresa Fortune 50, explicando cómo pensaba su equipo de seguridad sobre los agentes de IA en el SOC. Equipo inteligente. Programa serio. Ya habían conectado a Claude con algunas herramientas de detección y estaban viendo un valor real en investigaciones específicas. Pero mientras trazábamos la arquitectura más amplia, algo seguía molestándome. El diseño que estaban construyendo iba a funcionar maravillosamente para un pequeño porcentaje de alertas que realmente necesitaban un profundo juicio humano. Iba a ignorar por completo al resto.

En el vuelo de regreso a casa, tomé un libro que no había tocado en algunos años. Pensamiento rápido y lento de Daniel Kahneman. Kahneman es una de las pocas personas que realmente cambió la forma en que entendemos la toma de decisiones humanas. Pasó su carrera como psicólogo estudiando cómo piensa realmente la gente, a diferencia de cómo los economistas asumían que lo hacían. En 2002, ganó el Premio Nobel de Economía, lo que dice algo sobre hasta dónde llegó su trabajo más allá de su punto de partida.

El argumento central del libro es que la mente humana no es una sola cosa. Se trata de dos sistemas que funcionan en paralelo, a menudo en tensión.

El sistema 1 es el cerebro que funciona automáticamente. Reconoce patrones al instante, lee una habitación en segundos y te mantiene con vida sin esfuerzo consciente. Es rápido, asociativo e inconsciente. Según la investigación de Kahneman, el 95% de toda la cognición humana ocurre aquí, ejecutándose silenciosamente en segundo plano como un sistema operativo que nunca ves.

El Sistema 2 es el cerebro con el que te involucras en las cosas difíciles. Evaluar un contrato, resolver un problema sin una respuesta obvia y tomar una decisión bajo presión. Es lento, lógico, requiere esfuerzo y representa el 5% restante de nuestro pensamiento. Puede anular el Sistema 1 cuando el Sistema 1 está incorrecto. Pero tiene capacidad limitada. No puedes ejecutarlo a máxima potencia todo el día. Cuando se agota, el Sistema 1 se hace cargo de todos modos.

La idea central de Kahneman no es que un sistema sea mejor. Es que los errores que cometen los humanos casi siempre son el resultado de aplicar el sistema equivocado al trabajo equivocado. El pensamiento deliberado aplicado a cosas que deberían ser automáticas agota a la gente y aún así pasa por alto cosas. El pensamiento automático aplicado a cosas que realmente necesitan deliberación produce errores seguros.

Aterricé, abrí mi computadora portátil y me escribí una frase. «Esto es exactamente lo que está mal en la forma en que la mayoría de los equipos de seguridad están diseñando su arquitectura de IA en este momento».

Los números no son una coincidencia.

Kahneman dice que los humanos ejecutan el Sistema 1 para el 95% de su cognición y el Sistema 2 para el 5%. Investigación basada en el análisis de más de 25 millones de alertas empresariales descubrió que el 98% de las alertas se pueden resolver de forma autónoma y menos del 2% realmente justifica la revisión humana.

Esto es casi idéntico al ratio de Kahneman. El SOC que funciona bien no es un invento nuevo. Es la arquitectura la que refleja cómo operan realmente las mejores mentes para tomar decisiones. Procesamiento rápido y automático para la inmensa mayoría de las entradas y juicio humano deliberado reservado para la pequeña fracción que realmente lo necesita.

El CISO con el que estaba sentado estaba construyendo un SOC con un solo cerebro. Su equipo le pedía al Sistema 2 que hiciera el trabajo del Sistema 1, y luego le pedía al Sistema 2 nuevamente que hiciera aquello en lo que realmente es bueno, con la energía sobrante. No es de extrañar que sólo estuvieran cubriendo una fracción de sus alertas. No es de extrañar que los analistas estuvieran agotados. No es de extrañar que nunca se encontraran las verdaderas amenazas escondidas en la pila de baja gravedad. De acuerdo a investigación sobre más de 25 millones de alertasuna empresa con 450.000 alertas al año puede esperar que se oculten 54 amenazas reales exactamente en esas alertas, las que parecen ruido y las que nunca llegan al principio de la cola.

El rápido cerebro SOC para el 98% de las alertas

La mayor parte de la clasificación de alertas SOC es un problema del Sistema 1. ¿Se sabe que este archivo es malicioso? ¿Este inicio de sesión coincide con el comportamiento histórico? ¿Esta IP ha aparecido alguna vez en un caso que ya cerramos? Éstas no son cuestiones que requieran una larga deliberación. Necesitan respuestas, a la velocidad de una máquina, para cada alerta, las 24 horas del día.

Cuando los analistas humanos se ven obligados a hacer este trabajo, sucede lo mismo que cuando obligas a las personas a realizar tareas del Sistema 2 todo el día. Se ralentizan, simplifican y, finalmente, empiezan a saltar. Sólo clasifican lo que parece urgente. Las 54 amenazas que se esconden en la pila de baja gravedad permanecen ocultas, no porque alguien haya decidido ignorarlas, sino porque hay 4.000 alertas detrás de ellas y la capacidad cognitiva del equipo se agotó.

El cerebro autónomo del SOC necesita funcionar como funciona el Sistema 1. Continuamente, sin que nadie se lo indique, por debajo del umbral de la atención humana. Aplica una investigación profunda de nivel forense al 100 % de las señales. Escaneos de memoria, análisis de archivos, correlación de señales cruzadas entre terminales, identidades, redes y nubes. Cierra los casos que son claramente ruido y saca a la luz los casos que realmente necesitan un ser humano, con toda la evidencia ya reunida. No pide permiso. Produce veredictos.

Esto es lo que hace un AI SOC. Lo investiga todo, emite veredictos con un 98% de precisión en menos de dos minutos y entrega al equipo humano el 2% que realmente merece su atención.

El cerebro SOC lento para el 2% de las alertas

El Sistema 2 es donde Claude, Codex y Cursor pertenecen en un SOC. No porque sean lentos, sino porque el trabajo para el que son más adecuados es genuinamente deliberado. Análisis de casos complejos. Ingeniería de reglas de detección. Notificación de incidentes. Búsqueda de amenazas basada en un informe de la industria. Trabajo que requiere síntesis, juicio y capacidad de combinar los hallazgos forenses con el contexto empresarial que sólo tiene el analista.

Aquí es donde el encuadre del copiloto con IA tiene sentido, pero sólo cuando al copiloto no se le pide que gestione la pista. Cuando un agente de Claude se ocupa de un caso escalado, no debe comenzar a partir de una alerta sin formato. Debe comenzar con una investigación completamente ensamblada con todos los análisis forenses completados, las señales relacionadas correlacionadas y la respuesta recomendada redactada. El analista aplica su juicio a un caso curado y respaldado por evidencia. No están validando si valía la pena examinar la alerta. Están haciendo el trabajo que realmente necesita una mente humana.

Cuando el Sistema 2 recibe ese tipo de información, algo cambia. Lo que solía ser una tarde de intercambio de consolas se convierte en un intercambio breve y centrado. El analista deja de hacer cola y comienza a hacer el trabajo para el que realmente fue contratado. Y aquí está la parte que creo que el mercado aún no ha apreciado del todo. Cada juicio que hace el cerebro lento se retroalimenta al cerebro rápido. Cada regla de sintonía escrita en Claude, cada caso cerrado con un nuevo contexto, hace que la capa autónoma sea más precisa el mes siguiente. Los dos sistemas son compuestos. Se mejoran mutuamente con el tiempo.

Los dos modos de falla que se desarrollan en este momento

Kahneman pasó toda su carrera documentando lo que sucede cuando los humanos utilizan el sistema cognitivo incorrecto para resolver un problema. La industria de la seguridad está ejecutando ambos modos de falla simultáneamente y a escala.

El primero es el clásico. Mantener a los analistas humanos en el rol del Sistema 1. Clasificación manual de cientos de alertas al día, quemando capacidad cognitiva en trabajos que deberían automatizarse. El Sistema 2 del equipo se agota antes de llegar a los casos que realmente lo necesitan. La cobertura sufre. Se pasan por alto las amenazas. El equipo agrega personal y el problema aumenta linealmente en lugar de resolverse.

El segundo modo de fallo es el que está produciendo la actual ola de IA. Implementar una plataforma de IA de vanguardia directamente contra datos de detección sin procesar y llamarla AI SOC. Este también es el Sistema 2 haciendo el trabajo del Sistema 1, solo que más rápido y más costoso. El agente todavía necesita un humano para iniciar cada investigación. En volúmenes de alerta reales, la economía no se sostiene. Ejecutar un modelo de frontera para cada alerta con los costos simbólicos actuales no es viable en producción. Los equipos comienzan silenciosamente a omitir los de baja prioridad. Las 54 amenazas desatendidas siguen desaparecidas. El problema no está resuelto. Se renombra.

La arquitectura SOC que realmente refleja el cerebro

El SOC que tenga éxito en 2026 ejecutará ambos sistemas correctamente.

El cerebro rápido cubre todo automáticamente. Está diseñado específicamente para la investigación forense a escala, no es un modelo de lenguaje de propósito general. No espera indicaciones. No omite alertas de baja gravedad porque la cola es larga. Produce veredictos sobre el 100% de las señales y alimenta el cerebro lento con casos completamente ensamblados.

El cerebro lento funciona sobre esa base. Claude, Cursor, Codex, etc. reciben casos escalados con todo el contexto adjunto. Los analistas supervisan en lugar de clasificar. Y como ambos cerebros comparten la misma base de conocimientos, cada decisión que se toma en el espacio de trabajo de la IA hace que la capa autónoma sea más inteligente.

También hay una implicación estratégica aquí: creo que el mercado no se ha procesado completamente. Las empresas que subcontratan la investigación de alertas a un proveedor de MDR no son propietarias de la capa de conocimiento que surge de esa investigación. Las reglas de detección, el historial de casos, la lógica de clasificación y el contexto organizacional se acumulan dentro de la plataforma del proveedor. Cuando desea conectar Claude o Codex a sus operaciones de seguridad, está intentando ejecutar el Sistema 2 sobre una base que no le pertenece. El cerebro lento no tiene nada con qué trabajar.

Llevar la investigación internamente no es sólo una decisión de costo o cobertura. Es el requisito previo para que un analista copiloto sea realmente útil. Cada alerta investigada, cada caso resuelto, cada regla ajustada se acumula dentro de su propia instancia. Cuanto más rápido el Sistema 1 construye esa base, más poderoso se vuelve el Sistema 2.

La idea de Kahneman fue que los mejores tomadores de decisiones no son aquellos que piensan más rápido o más intensamente. Son aquellos que saben qué modo exige el momento y han diseñado sus vidas para que cada sistema se aplique a los problemas correctos.

Los equipos de seguridad que hagan esto bien en 2026 no serán los que tengan más analistas ni el modelo de lenguaje más potente. Ellos serán quienes diseñaron un SOC donde el cerebro rápido maneja todo lo que debe y el cerebro lento queda libre para hacer lo que debe hacer.

La IA se ejecuta. Los humanos supervisan. Y cuando la arquitectura es correcta, la supervisión es la mejor parte del trabajo.

¿Encontró interesante este artículo? Obtenga más información aquí.

Nota: Este artículo ha sido escrito y contribuido de manera experta por Lital Asher-Dotan, CMO de Intezer.

¿Encontró interesante este artículo? Este artículo es una contribución de uno de nuestros valiosos socios. Síguenos en noticias de google, Gorjeo y LinkedIn para leer más contenido exclusivo que publicamos.

Una herramienta de IA autónoma encuentra un defecto RCE de hace 2 años en Redis (CVE-2026-23479) – CYBERDEFENSA.MX

Redis tiene parcheado un uso después de la liberación en su código de cliente de bloqueo que permite a un usuario autenticado ejecutar comandos arbitrarios del sistema operativo en la máquina que aloja la base de datos. La falla fue encontrada por una herramienta de inteligencia artificial autónoma diseñada para detectar errores en grandes bases de código.

Seguimiento como CVE-2026-23479la falla se introdujo en Redis 7.2.0 y permaneció en todas las ramas estables hasta las correcciones del 5 de mayo, sin que nadie se diera cuenta durante más de dos años. NVD lo califica con 8,8 según CVSS 3,1; Redis lo enumera como 7.7 en CVSS 4.0. Fue informado por Team Xint Code, y una completa técnica escribir ahora es público.

La huella de la nube empeora esto. El análisis de Wiz, publicado con el informe del exploit, coloca a Redis en una gran mayoría de entornos de nube, y la mayoría de esas instancias se ejecutan sin contraseña. El exploit necesita una sesión autenticada, pero en una implementación predeterminada, el usuario predeterminado ya posee todos los privilegios que requiere la cadena.

El defecto vive en desbloquearClientOnKey() en src/bloqueado.cque se activa cuando un evento clave activa un comando bloqueado. La función envía el comando en cola a través de procesoCommandAndResetClient()luego sigue usando el mismo puntero de cliente. El problema: esa función puede liberar al cliente como efecto secundario, y su propio comentario en el encabezado lo dice. La persona que llama ignora el valor de retorno y lee la estructura liberada de todos modos, un uso después de la liberación (CWE-416).

Según el análisis de Wiz, el error requirió dos confirmaciones para crearse. Una refactorización de enero de 2023 (PR #11012) agregó la llamada no marcada. Un cambio de marzo de 2023 (PR #11568) agregó más acceso de cliente después. Ninguno de los dos era peligroso por sí solo. Juntos, alcanzaron la disponibilidad general en 7.2.0 y sobrevivieron a múltiples rondas de revisión de seguridad.

Ciberseguridad

La cadena comienza filtrando una dirección de montón. A partir de ahí, libera a un cliente e introduce uno falso en la misma memoria, luego convierte la propia memoria de Redis en contra de sí misma para sobrescribir un puntero de función.

La versión publicada se ejecuta en tres etapas.

  • Primero, un script Lua de una línea (EVAL «return tostring(redis.call)» 0) pierde un puntero de montón.
  • En segundo lugar, el atacante prepara los límites de memoria del cliente, estaciona un cliente inflado en una secuencia, luego elimina los límites y lo activa. Redis libera al cliente bloqueado en mitad de la llamada y un SET canalizado recupera inmediatamente el espacio liberado con una estructura de cliente falsa.
  • En tercer lugar, la contabilidad de memoria de rutina de Redis en updateClientMemoryUsage() realiza una disminución fuera de los límites utilizando campos controlados por el atacante, dirigidos a la tabla de compensación global para redireccionar strcasecmp() a system(). El siguiente comando que Redis analiza se ejecuta como un comando de shell.

La imagen oficial de Redis Docker facilita el último paso. Se envía solo con RELRO parcial, lo que permite que GOT se pueda escribir en tiempo de ejecución. ASLR y PIE no ayudan aquí, ya que la escritura es relativa a un global cuyo desplazamiento se fija en el momento de la compilación.

La cadena completa necesita una sesión autenticada con CONFIG SET, EVAL, comandos de transmisión (XREAD/XADD) y SET/GET básico, que se asigna a las categorías ACL @admin, @scripting, @stream y @read/@write.

El usuario predeterminado los tiene todos y, en la mayoría de las implementaciones, estos privilegios se agrupan en una única aplicación compartida o función de operador. Negar CONFIG por completo rompe esta cadena específica, aunque no el uso después de la liberación subyacente.

El equipo Xint Code demostró el funcionamiento del RCE en ZeroDay.Nube 2025la competencia de piratería de Wiz en Londres el pasado diciembre. teoría describe Código Xint como una herramienta de seguridad de IA autónoma creada para detectar errores en grandes bases de código.

Redis dijo que no tenía evidencia de explotación en su propio entorno o en el de sus clientes, y hasta el momento de esta publicación no ha aparecido ningún informe público al respecto. La cadena técnica completa ahora es pública, lo que aumenta el riesgo de explotación posterior.

Ciberseguridad

Actualice al parche menor para su serie: 7.2.14, 7.4.9, 8.2.6, 8.4.3 u 8.6.3, todos lanzados el 5 de mayo. Las actualizaciones menores dentro de una serie deben ser inmediatas. Los servicios administrados de Redis se actualizan según sus propios cronogramas y Redis dice que Redis Cloud ya está listo.

Rama Afectado Fijado
7.2.x 7.2.0 a 7.2.13 7.2.14
7.4.x 7.4.0 a 7.4.8 7.4.9
8.2.x 8.2.0 a 8.2.5 8.2.6
8.4.x 8.4.0 a 8.4.2 8.4.3
8.6.x 8.6.0 a 8.6.2 8.6.3

Si aún no puede parchear: mantenga Redis fuera de la Internet pública y detrás de TLS, ajuste las ACL para que ningún rol mantenga juntos a @admin, CONFIG y @scripting, y deniegue @scripting si no usa Lua, lo que elimina la fuga de la Etapa 1.

Priorice las instancias expuestas a Internet, las credenciales de aplicaciones compartidas y cualquier función que combine CONFIG, secuencias de comandos y acceso a transmisiones. Mientras lo hace, rote las credenciales de Redis ampliamente compartidas.

CVE-2026-23479 fue uno de cinco fallas de Redis de clase RCE revelado el mes pasado, y sigue a la falla RediShell 2025 de Redis, otro uso después de la liberación autenticado que involucra secuencias de comandos Lua. También es el que detectó una herramienta de inteligencia artificial. Dos confirmaciones lo colocaron, dos años lo ocultaron y permaneció en una de las bases de datos más implementadas hasta que un concurso de piratería lo sacó a la luz. La revisión del código nunca lo hizo.

Los investigadores dicen que la IA acaba de superar todos los estándares de capacidad cibernética autónoma

Dos de los modelos de inteligencia artificial más avanzados, Claude Mythos Preview de Anthropic y GPT-5.5 de OpenAI, han superado significativamente el ritmo ya acelerado al que los sistemas de IA están completando tareas autónomas de ciberseguridad, según hallazgos separados publicados el miércoles por el Instituto de Seguridad de IA (AISI) del Reino Unido y Palo Alto Networks.

El AISI, que lleva a cabo evaluaciones previas al despliegue de modelos fronterizos de IA en nombre del gobierno británico, dijo que tanto Claude Mythos Preview como GPT-5.5 han superado sustancialmente la tendencia de duplicación que el instituto había estado siguiendo desde finales de 2024. Aún no está claro si los resultados representan un salto de capacidad aislado o el comienzo de una trayectoria nueva y más rápida.

El AISI estimó a principios de este año que el horizonte temporal cibernético de confiabilidad del 80% de los modelos de frontera (una medida de cuánto tiempo lleva a un experto humano una tarea, utilizada como indicador de la autonomía de la IA) se había duplicado aproximadamente cada cinco meses. Eso fue en sí mismo aproximadamente la mitad del tiempo de duplicación de ocho meses que el instituto estimó en noviembre de 2025. Desde entonces, Mythos Preview y GPT-5.5 han superado cualquier línea de tendencia que haya medido el instituto.

«La capacidad cibernética y de software autónoma de Frontier AI está avanzando rápidamente: la duración de las tareas cibernéticas que los modelos fronterizos pueden completar de forma autónoma se ha duplicado en el orden de meses, no de años». el AISI escribió.

La evidencia más clara del salto de capacidad provino de los alcances cibernéticos del AISI, sus simulaciones estructuradas de ataques de múltiples etapas contra redes empresariales pequeñas e indefensas. Un nuevo puesto de control de Claude Mythos Preview se convirtió en el primer modelo en completar ambas gamas del instituto. Resolvió «The Last Ones», un ataque simulado a una red corporativa de 32 pasos, en 6 de 10 intentos, y completó «Cooling Tower», que ningún modelo había resuelto previamente, en 3 de 10 intentos. GPT-5.5 resolvió «Los últimos» en 3 de 10 intentos.

Redes de Palo Alto llegó a conclusiones similares a través de sus propias pruebas. La compañía dijo que comenzó a probar Claude Mythos en abril como socio de lanzamiento del Proyecto Glasswing de Anthropic, y desde entonces ha probado Claude Opus 4.7 y GPT-5.5-Cyber ​​de OpenAI como parte del programa Trusted Access for Cyber ​​de OpenAI.

«Los últimos modelos son extraordinariamente capaces de encontrar vulnerabilidades y convertirlas en rutas de explotación críticas casi en tiempo real», escribió Palo Alto Networks.

La empresa publicó avisos de seguridad. cubriendo 26 CVE que representan 75 problemas (en comparación con un volumen mensual típico de menos de cinco CVE) que se identificaron mediante el escaneo de modelos de IA en más de 130 productos. Se habían solucionado todas las vulnerabilidades importantes de sus productos SaaS y había parches disponibles para todos los productos operados por el cliente.

El AISI tuvo cuidado de señalar los límites de sus datos. Las estimaciones se basan en una cantidad relativamente pequeña de modelos, y las tareas más difíciles del conjunto de pruebas tienen la menor cantidad de datos de comparación humana. Aun así, el instituto dijo que la tendencia general se mantiene: eliminar cualquier modelo del análisis apenas mueve la aguja, desplazando el tiempo estimado de duplicación en menos de un mes en cualquier dirección. Separar la investigación de METROuna organización sin fines de lucro que rastrea la rapidez con la que la IA maneja tareas de software, llegó a una cifra casi idéntica: un tiempo de duplicación de aproximadamente cuatro meses desde finales de 2024.

«Ningún resultado de referencia debe interpretarse como una medida precisa de la capacidad de la IA», escribió el AISI. «De todos modos, la dirección del cambio y el rápido crecimiento han sido consistentes en todos los modelos, opciones metodológicas y datos independientes que examinamos».

Palo Alto Networks describió cuatro prioridades inmediatas para las empresas a medida que estos modelos continúan creciendo en uso: primero, encontrar y corregir vulnerabilidades en el código y las aplicaciones antes de que lo hagan los atacantes. En segundo lugar, reducir la superficie de ataque y utilizar la IA para detectar errores de configuración de seguridad. En tercer lugar, implementar herramientas de detección y respuesta en todos los sistemas, utilizando el aprendizaje automático para detectar amenazas en tiempo real. En cuarto lugar, desarrollar operaciones de seguridad lo suficientemente rápidas como para responder en minutos, porque los ataques impulsados ​​por IA pronto podrían desarrollarse con esa rapidez.

El AISI dijo que está desarrollando evaluaciones más exigentes, incluidos nuevos rangos cibernéticos y la adición de defensas cibernéticas activas, para reflejar mejor las condiciones del mundo real a medida que las capacidades del modelo continúan avanzando.

Greg Otto

Escrito por Greg Otto

Greg Otto es el editor en jefe de CyberScoop y supervisa todo el contenido editorial del sitio web. Greg ha dirigido una cobertura de ciberseguridad que ha ganado varios premios, incluidos los de la Sociedad de Periodistas Profesionales y la Sociedad Estadounidense de Editores de Publicaciones Empresariales. Antes de unirse a Scoop News Group, Greg trabajó para Washington Business Journal, US News & World Report y WTOP Radio. Tiene una licenciatura en periodismo televisivo de la Universidad de Temple.