El nuevo modelo de Anthropic es Mythos con correa

A principios de este año, los ejecutivos de Anthropic dijeron que su nuevo modelo de IA, Claude Mythos, tenía capacidades tan poderosas para causar daño que no lo harían público.

El martes, la compañía dijo que estaba poniendo a disposición del público una versión alterada de Mythos, prometiendo «nuevas barreras» que frustren el mejor desempeño del modelo en piratería informática e investigación de armas biológicas.

Anthropic dijo que Claude Fable 5 era el «mismo modelo subyacente» que Mythos, pero sus respuestas para ciertos temas como la ciberseguridad y la biología se extraerán de un modelo anterior de Claude Opus que ya es público.

«Lanzar un modelo con esta capacidad conlleva riesgos. Sin salvaguardias, las capacidades de Fable 5 en áreas como la ciberseguridad podrían usarse indebidamente para causar daños graves», dijo la compañía en un borrador del blog enviado a CyberScoop antes del anuncio. «Por lo tanto, hemos lanzado el modelo con salvaguardas que dirigen consultas sobre un conjunto limitado de temas a nuestro siguiente modelo más capaz, Claude Opus 4.8».

Anthropic también dijo que sometieron a Fable 5 a pruebas internas y externas del equipo rojo para detectar vulnerabilidades comunes del modelo, como el jailbreak. Anthropic dijo que estas pruebas no identificaron técnicas de jailbreak «universales» conocidas, pero no especifica si se descubrieron técnicas de jailbreak parcial.

La compañía apuesta a que eso no cambiará cuando Fable 5 esté disponible para el público en general, pero vale la pena señalar que los investigadores de ciberseguridad han encontrado constantemente formas de hacer jailbreak a modelos de IA más antiguos.

«La mejora de las capacidades a nivel de Mythos es valiosa para muchos adversarios (por ejemplo, aquellos que podrían beneficiarse económicamente de los ataques cibernéticos) y, por lo tanto, esperamos que estén motivados para intentar eludir nuestras medidas de seguridad», escribió la compañía.

Anthropic está cambiando sus políticas de retención de datos para los modelos Fable y Mythos, manteniendo todo el tráfico de usuarios durante 30 días tanto en sus propias plataformas como en servicios de terceros. Este período de 30 días se alinea con una orden ejecutiva de la Casa Blanca que creó un marco voluntario para que las empresas de inteligencia artificial compartan modelos fronterizos con el gobierno antes de su publicación pública. La compañía dice que los datos retenidos no se utilizarán para entrenar nuevos modelos Claude ni para «ningún propósito no relacionado con la seguridad».

La mayoría de las organizaciones todavía están decidiendo si adoptarán la IA en su ecosistema de TI y ciberseguridad. Pero modelos como Mythos pueden buscar vulnerabilidades, encadenar exploits y robar datos de la red de una víctima en minutos. La automatización en la piratería existía antes que la IA, pero los expertos han dicho que modelos de frontera como Daybreak de Mythos OpenAI pueden permitir que incluso los ciberdelincuentes de bajo nivel causen estragos.

Si bien Anthropic citó su compromiso con el desarrollo de una IA segura como motivo para no publicar Mythos, muchas organizaciones han estado clamando por el acceso, y sus funciones mejoradas de ciberseguridad en ciberseguridad y otras áreas han sido objeto de audiencias en el Congreso, documentos de seguridad nacional y órdenes ejecutivas de la Casa Blanca.

Lanzar una versión limitada del modelo en Fable 5 representa un intento de dividir la diferencia entre esos dos deseos. Anthropic dijo que publicaría puntos de referencia y activos de seguimiento para el modelo.

Entonces, ¿qué puede hacer Fable 5?

Anthropic dijo que es posible que las restricciones integradas en Fable dificulten que el modelo cumpla con las solicitudes de los usuarios tanto maliciosos como legítimos.

«Debido a que hemos priorizado la seguridad, hemos ajustado deliberadamente las salvaguardas para que sean cautelosas y aún son más estrictas de lo que sería ideal; por ejemplo, a veces solicitudes benignas activarán nuestros clasificadores», escribió la compañía. «Reconocemos que esto resultará frustrante para algunos usuarios y nuestro objetivo es reducir los falsos positivos a medida que actualizamos y perfeccionamos las medidas de seguridad después del lanzamiento».

Si Fable 5 extrae sus respuestas de ciberseguridad y biología completamente de Claude Opus 4.8, seguirá proporcionando a los usuarios capacidades de ciberseguridad de doble uso impresionantes, aunque no únicas.

Según el tarjeta del sistema Publicado para Opus 4.8, el modelo es una ligera mejora con respecto a modelos anteriores como el 4.7 en el ámbito de la ciberseguridad, pero era «en general mucho menos capaz que Mythos Preview».

Se probó la capacidad de Opus 4.8 para escribir exploits completos de extremo a extremo y crear primitivas de exploits que brinden a los atacantes la capacidad de ejecutar código arbitrario. Promedió una puntuación de sólo 5 sobre 16 en competencia, en comparación con Mythos Preview, que obtuvo una puntuación más cercana a 10.

Sin barreras de seguridad, Opus 4.8 aún puede reproducir casi el 80% de las vulnerabilidades descubiertas previamente en proyectos reales de software de código abierto cuando se le proporciona una descripción de alto nivel de la debilidad. La tarjeta del sistema decía que las salvaguardas no especificadas de Anthropic reducen esta tasa de éxito al 1%.

Otra prueba que evaluó la capacidad de Opus para desarrollar exploits para el popular navegador Firefox encontró que, nuevamente sin barreras de seguridad, el modelo podía identificar un exploit funcional completo el 8,8% de las veces y un exploit funcional parcial el 68,8% de las veces.

La compañía también dijo que los miembros del Proyecto Glasswing, un consorcio de empresas públicas y privadas a las que se les dio acceso a una versión preliminar de Mythos, podrán actualizar al último modelo completo, Claude Mythos 5, para continuar su trabajo. El acceso a Mythos 5 se ampliará con el tiempo “a través de un programa de acceso confiable más sistemático” que incluya agencias federales.

Derek B. Johnson

Escrito por Derek B. Johnson

Derek B. Johnson es reportero de CyberScoop, donde su área incluye la ciberseguridad, las elecciones y el gobierno federal. Antes de eso, ha brindado una cobertura galardonada de noticias sobre ciberseguridad en los sectores público y privado para varias publicaciones desde 2017. Derek tiene una licenciatura en periodismo impreso de la Universidad de Hofstra en Nueva York y una maestría en políticas públicas de la Universidad George Mason en Virginia.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *