OpenAI presenta una vista previa de GPT-5.6 Sol con acceso restringido y salvaguardias cibernéticas más sólidas – CYBERDEFENSA.MX

OpenAI lanzó el viernes tres versiones de GPT-5.6llamado Sol, Tierra y Lunacomo un avance limitado para un pequeño número de empresas como parte de un compromiso continuo con el gobierno de EE. UU.

Si bien Sol es el último modelo insignia y el más poderoso, Terra logra un equilibrio entre eficiencia y potencia, y Luna está optimizado para velocidad y asequibilidad.

«GPT‑5.6 Sol se lanza con nuestra pila de seguridad más sólida hasta la fecha. Reforzamos las protecciones para actividades de mayor riesgo, solicitudes cibernéticas sensibles y uso indebido repetido, y pasamos varias semanas buscando debilidades, probando nuestro sistema y fortaleciéndolo contra ataques del mundo real», OpenAI dicho.

El modelo también ha sido promocionado como el «modelo más capaz hasta ahora» para la ciberseguridad, lo que lo hace mucho más adecuado para la investigación y explotación de vulnerabilidades. En Banco de explotación GPT‑5.6 Sol es competitivo con Anthropic Mythos Preview utilizando solo aproximadamente un tercio de los tokens de salida, señaló OpenAI.

El objetivo, añadió, es permitir el acceso a trabajos legítimos como revisión de código, investigación de vulnerabilidades, desarrollo de parches, depuración, educación sobre seguridad y pruebas defensivas, al tiempo que se aplican barreras de seguridad sólidas que bloquean la actividad ofensiva y se remedian rápidamente los jailbreaks recién descubiertos. Esto incluye intentos contradictorios de liberar el modelo y rechazar lo que describe como «asistencia cibernética prohibida».

Ciberseguridad

«A medida que estas capacidades continúan avanzando, nuestra prioridad es asegurarnos de que lleguen y beneficien a los defensores, quienes pueden usar estas herramientas para encontrar debilidades, desarrollar parches y fortalecer los sistemas de manera más amplia», explicó la compañía de inteligencia artificial (IA).

Dicho esto, OpenAI también advierte que puede haber escenarios durante la fase de vista previa en los que los usuarios pueden encontrar salvaguardas que bloqueen o rechacen solicitudes legítimas, o que sus solicitudes se detengan para una revisión adicional, debido a «naturaleza de «doble uso» de la tecnología.

Según la tarjeta de sistema de vista previa GPT-5.6 de OpenAI, aunque el modelo es más hábil para encontrar vulnerabilidades en el código y desarrollar exploits, las capacidades no se extienden a llevar a cabo ataques autónomos de extremo a extremo contra objetivos protegidos ni a convertir esas vulnerabilidades cibernéticas en armas en ataques reales.

«Evaluaciones separadas examinaron el comportamiento desalineado en tareas de codificación agente y encontraron que GPT-5.6 muestra una mayor tendencia que GPT-5.5 a ir más allá de la intención del usuario, incluso tomando o intentando acciones que el usuario no había solicitado, aunque las tasas absolutas siguen siendo bajas», señaló.

Una evaluación de GPT-5.6 Sol frente a proyectos de software reforzado ampliamente implementados que utilizan VulnLMP, que es el marco interno de OpenAI diseñado para probar el desarrollo de cadenas de exploits de extremo a extremo contra objetivos del mundo real, ha descubierto que el modelo produce pistas creíbles de seguridad de memoria, algunas de las cuales podrían conducir a divulgación, mutación o corrupción del flujo de control.

«Esto sugiere que partes sustanciales de la investigación de vulnerabilidades del mundo real se están volviendo cada vez más automatizables cuando los modelos se combinan con el uso de herramientas, sistemas de construcción e infraestructura de verificación», dijo el advenedizo tecnológico.

OpenAI tiene la intención de que GPT-5.6 Sol, Terra y Luna estén disponibles de forma generalizada en las próximas semanas, y presentó una vista previa de las capacidades del modelo al gobierno de EE. UU. También está lanzando una vista previa limitada para un pequeño grupo de socios confiables cuya participación ha sido aprobada por el gobierno antes de un lanzamiento más amplio.

Ciberseguridad

A principios de este mes, el presidente estadounidense Donald Trump firmado una orden ejecutiva sobre IA y ciberseguridad, que pide la creación de un marco que otorgue al gobierno federal la capacidad de evaluar las capacidades de los modelos de IA y determinar cuáles califican como «modelos de frontera cubierta», una designación para sistemas de IA con capacidades cibernéticas avanzadas.

El lanzamiento escalonado se produce días después de que la compañía lanzara una versión mejorada de su modelo GPT‑5.5‑Cyber ​​para defensores confiables como parte de la iniciativa Daybreak y lanzara un nuevo proyecto llamado Patch the Planet en colaboración con Trail of Bits para ayudar a proteger proyectos de código abierto.

También sigue a la decisión del gobierno de EE. UU. de permitir a Anthropic lanzar su modelo Mythos AI a un grupo de alrededor de 100 empresas confiables y agencias del gobierno federal que «operan y defienden infraestructura crítica», más de dos semanas después de que los poderosos modelos centrados en la ciberseguridad fueran retirados del mercado.

«Estamos restaurando el acceso para estas organizaciones rápidamente y continuamos trabajando con el gobierno para ampliar el acceso a Mythos 5 y hacer que Fable 5 esté nuevamente disponible para uso general», Anthropic dicho en un comunicado publicado en X.

Anthropic lanza Claude Fable 5, su IA más poderosa hasta el momento, con salvaguardias cibernéticas – CYBERDEFENSA.MX

El 9 de junio, Antrópico lanzado Claude Fábula 5el modelo más capaz que jamás haya fabricado, está disponible de forma generalizada. También hizo algo inusual: envió un modelo como dos productos, divididos no por capacidad sino por una capa de clasificadores de seguridad.

Fábula 5 sale al público. Su gemelo, Claude Mythos 5, el mismo modelo subyacente con las salvaguardas cibernéticas eliminadas, permanece restringido a un grupo examinado de ciberdefensores y operadores de infraestructura crítica.

Anthropic considera que Mythos 5 es el modelo de ciberseguridad más sólido del mundo.

La diferencia práctica es la siguiente: Fable 5 enruta las solicitudes cibernéticas, biológicas, químicas y de destilación al Claude Opus 4.8, más débil, mientras que Mythos 5 mantiene las capacidades cibernéticas disponibles para los usuarios examinados. Ambos modelos cuestan 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, menos de la mitad del precio del Mythos Preview anterior, y Fable 5 ya está disponible a través de la API de Claude.

Está incluido en los planes Pro, Max, Team y Enterprise basados ​​en asientos sin costo adicional hasta el 22 de junio y luego pasa a créditos de uso.

Cómo funcionan los clasificadores cibernéticos de Fable 5

La división existe porque los modelos de clase Mythos encuentran y explotan vulnerabilidades de software lo suficientemente bien como para que, en el marco de Anthropic, entregar esa capacidad al público en general sin controles daría a los atacantes un gran beneficio.

El mecanismo es un conjunto de clasificadores: sistemas de IA separados que vigilan el mal uso y los intentos de jailbreak. Cuando una solicitud lo hace tropezar, Fable 5 no se niega. La respuesta se entrega a Opus 4.8 y se le informa al usuario que se produjo la transferencia. De las categorías marcadas, la destilación es la que destaca: significa extraer las capacidades de un modelo para entrenar un modelo competidor, que Anthropic bloquea para evitar que las habilidades cercanas a la frontera se filtren sin salvaguardias adjuntas.

Ciberseguridad

El clasificador de ciberseguridad es el amplio. Anthropic lo diseñó para bloquear no sólo el desarrollo de exploits sino también las tareas cibernéticas ofensivas en general: reconocimiento, descubrimiento, movimiento lateral, los pasos de agencia que conforman un ataque real.

En una evaluación interna ejecutada con Fable 5 configurado para bloquear en lugar de retroceder, y que no intentó evadir las salvaguardas, los clasificadores impidieron que el modelo progresara en esas tareas. Un socio externo descubrió que Fable 5 cumplió con cero solicitudes dañinas de un solo turno sobre planificación de ataques cibernéticos, desarrollo de exploits o evasión de defensa, resistiendo 30 técnicas públicas diferentes de jailbreak.

La compensación son los falsos positivos. Anthropic ajustó las medidas de seguridad de manera conservadora para realizar envíos rápidos, por lo que a veces detectan solicitudes inofensivas. La compañía dice que el respaldo se activa en menos del 5% de todas las sesiones, por lo que durante más del 95%, Fable 5 se comporta como el Mythos 5 cibernético sin restricciones. Esa cifra cubre todos los respaldos, incluidos los bloques genuinos, por lo que limita la interrupción total en lugar de medir la tasa de falsos positivos por sí solo. Anthropic dice que reducirá las salvaguardas y eliminará los falsos positivos después del lanzamiento.

En cuanto a la solidez, las cifras son específicas. Una recompensa por errores externos duró más de 1000 horas y no produjo ningún jailbreak universal, ni un aviso ni un arnés que elimine las salvaguardias por completo. Los equipos rojos externos tampoco encontraron ninguno en tareas de agente de larga duración, con una advertencia que Anthropic afirma claramente: el Instituto de Seguridad de IA del Reino Unido avanzó hacia un jailbreak universal dentro de una breve ventana de prueba inicial. Anthropic admite que probablemente sea imposible prevenir por completo los jailbreaks universales, y su objetivo declarado es hacer que aquellos que sigan siendo lo suficientemente lentos y costosos como para detectarlos antes de que se utilicen a escala.

¿Por qué la capacidad es una amenaza?

Los argumentos a favor de tratar este modelo con cuidado se expusieron en abril, cuando Anthropic lanzó Vista previa de Claude Mythos para un grupo limitado a través de Proyecto Ala de Vidrio. El redacción técnica del equipo rojo de Anthropic es la parte que vale la pena leer.

Durante las pruebas, Mythos Preview identificó y aprovechó vulnerabilidades de día cero en todos los principales sistemas operativos y en todos los principales navegadores web cuando un usuario lo indicó. El error más antiguo que encontró fue una falla de hace 27 años en OpenBSD, un sistema operativo conocido principalmente por su seguridad. Escribió de forma autónoma un exploit de ejecución remota de código contra el servidor NFS de FreeBSD a partir de un error de hace 17 años, clasificado como CVE-2026-4747.

Anthropic describe el resultado como raíz completa para un atacante no autenticado desde cualquier lugar de Internet; La entrada de NVD es más mesurada, teniendo en cuenta que el desbordamiento de la pila en sí no requiere que el cliente se autentique, sino que encuadra la ejecución del código del kernel como accesible para un atacante capaz de enviar paquetes al servidor NFS mientras el módulo kgssapi.ko está cargado.

Según el propio Anthropic, no entrenó explícitamente estas capacidades en; surgieron como un efecto secundario de mejoras generales en el código, el razonamiento y la autonomía, las mismas ganancias que hacen que el modelo sea mejor en la aplicación de parches. La advertencia categórica del equipo rojo: las mitigaciones cuyo valor de seguridad proviene de la fricción en lugar de barreras duras se vuelven mucho más débiles frente a un modelo que avanza a través de tediosos pasos de explotación a escala.

Barreras técnicas duras como KASLR y W^X aún aumentan el costo; la advertencia es más limitada, dirigida a defensas que dependen de la paciencia del atacante o del esfuerzo manual, y el modelo ahora puede autoabastecerse.

Mythos 5 lleva adelante esas habilidades. Anthropic dice que los usuarios lo encontrarán comparable o algo más potente que Mythos Preview.

El verdadero problema del defensor

El argumento defensivo no es hipotético. En las primeras semanas del Proyecto Glasswing, Anthropic y aproximadamente 50 socios utilizaron Mythos Preview para encontrar más de diez mil vulnerabilidades de gravedad alta o crítica en software de importancia sistémica.

Solo Cloudflare encontró 2000 errores, 400 de ellos de gravedad alta o crítica. Mozilla encontró y solucionó 271 en Firefox 150, más de diez veces lo que detectó en Firefox 148 usando el antiguo Opus 4.6. Anthropic dice que la misma presión es visible más allá de Glasswing, en los proveedores que envían versiones de seguridad inusualmente grandes.

Esa inundación es el truco. Encontrar errores ahora es barato y rápido. Verificarlos, clasificarlos y parchearlos no lo es, y aún funciona en tiempo humano.

Anthropic informa que los mantenedores de código abierto, ya enterrados bajo informes de errores de baja calidad generados por IA, le han pedido que ralentice sus divulgaciones porque no pueden escribir parches lo suficientemente rápido. En Glasswing, dice que un error de gravedad alta o crítica encontrado por el modelo tarda unas dos semanas en corregirse en promedio.

El cuello de botella ha pasado del descubrimiento a la solución, y la brecha entre una divulgación pública y un parche implementado es donde viven los atacantes. Los experimentos del día N del equipo rojo agudizan el punto: partiendo de nada más que un CVE revelado y su parche, Mythos Preview creó exploits de escalada de privilegios de Linux en menos de un día cada uno, con unos pocos miles de dólares o menos en cómputo.

Ciberseguridad

Para los defensores, la lectura es la misma de siempre, solo que en un tiempo más corto: asumir que un CVE de alta gravedad puede convertirse en un exploit funcional a las pocas horas de su divulgación, no semanas. Eso significa priorizar las rutas de actualización automática para los sistemas conectados a Internet y tratar los problemas de dependencia que conllevan correcciones CVE como un trabajo urgente en lugar de un trabajo atrasado.

La MFA y el registro integral siguen siendo la base, por lo que un único parche perdido no se convierte en lo único que se interpone entre un atacante y la red. Anthropic ha abierto una Programa de verificación cibernética que permite a los profesionales de seguridad examinados utilizar sus modelos para trabajos ofensivos legítimos sin las salvaguardias cibernéticas.

Un nuevo requisito de retención de datos de 30 días

Anthropic también está cambiando la forma en que maneja los datos para los modelos de clase Mythos.

Requerirá una retención de 30 días para todo el tráfico en Fable 5, Mythos 5 y modelos futuros en este nivel de capacidad, tanto en superficies propias como de terceros. La compañía dice que no utilizará los datos para capacitación ni ningún propósito que no sea de seguridad, registrará todo acceso humano y los eliminará después de 30 días, excepto cuando una investigación de seguridad u obligación legal requiera conservarlos por más tiempo.

La razón declarada es defensiva: los datos ayudan a detectar nuevos ataques y jailbreaks que operan en muchas solicitudes. Los equipos con requisitos estrictos de manejo de datos querrán tener en cuenta esa ventana de retención antes de enrutar el tráfico confidencial a través de estos modelos.

Anthropic planea ampliar el acceso a Mythos 5 a través de un programa de acceso confiable y dice que una vez que la capacidad de cómputo se ponga al día, su objetivo es volver a incluir Fable 5 en planes de suscripción sin la prima de crédito de uso que entrará en vigor después del 22 de junio.

La pregunta más importante que plantea el lanzamiento es la que Anthropic ha estado dando vueltas desde abril: están llegando modelos con capacidades similares de otros laboratorios, y no todos se enviarán con una pared de clasificadores al frente. La ventaja defensiva que Glasswing debía comprar sólo importa si el resto de la industria la utiliza.