Claude Used to Automate Exploitation and Data Theft Across Multiple Victims – CYBERDEFENSA.MX

Anthropic has warned that cybercriminals and state-sponsored hackers alike are using its Claude models for cyber attacks, weapons design, propaganda, and mass surveillance between December 2025 and August 2026.

The threat actors, which the artificial intelligence (AI) company has branded Generative Threat Groups (GTGs), span state-sponsored groups, financially motivated criminals, commercial spyware vendors, state propaganda institutions, and politically motivated individuals.

«The cybersecurity skills of AI models means that AI has collapsed the labor and tooling gap that used to separate well-resourced, state-sponsored operations from individual operators,» Anthropic said. «The use of AI went beyond simple questions and responses from a chatbot but rather involved the use of multi-agent frameworks executing reconnaissance, exploitation, and data exfiltration.»

Among the notable cases highlighted by Anthropic is the development of an AI-assisted workflow by a Russian state-sponsored threat actor it calls GTG-20006, which shares tactical and tradecraft overlaps with a Russian advanced persistent threat (APT) group tracked as Midnight Blizzard (aka APT29 and Cozy Bear). Some of the other AI-enabled cyber campaigns highlighted by Anthropic in its 154-page report include –

  • GTG-50014 (aka MeowSHA, frkoo, and blazespider), a French-speaking operator and a suspected affiliate of the ShinyHunters collective that ran a distributed credential-harvesting pipeline across a fleet of 10 AWS EC2 workers that mass-downloaded 1.8 million distinct Android APKs from multiple app-store sources, scanned them for hard-coded secrets using TruffleHog, and sent verified findings to a Telegram group.
  • Another ShinyHunters affiliate that specialized in supply chain theft by compromising software-as-a-service (SaaS) vendors to steal data belonging to downstream customers, accelerate reconnaissance, and enable data exfiltration.
  • GTG-10007, a Chinese-speaking operator likely based out of Hunan province, some of whom have been identified as undergraduate students at a Chinese university and have used Claude to conduct intrusion attempts against production systems, reconnaissance of foreign-government networks across the Middle East, Europe, and Southeast Asia, a vulnerability-research and exploit development effort against major endpoint-security products, and develop an intelligence-collection platform for bulk-harvesting of open-source material aligned with Beijing’s priorities. The threat actor targeted about 50 organizations across education, retail, energy, technology, healthcare, finance, manufacturing, and government sectors globally. The group also maintained an autonomous vulnerability research program to produce working exploits for previously unknown vulnerabilities in network and security appliances.
  • GTG-50021, a Russian and Ukrainian-speaking group that ran a fraudulent AI reseller operation offering cheap Claude access, only for customers’ traffic to be silently proxied to a different AI model, while the illicit scheme installed a credential harvester to siphon their Anthropic account credentials and sell them to other proxy resellers for malicious use.
  • GTG-50020, a Russian-speaking, financially-motivated actor that has historically targeted hotel booking and financial technology platforms but has since focused on the AI supply chain by stealing model provider API keys and unsuccessfully attempting to gain access to pre-release AI models. The threat actor is estimated to have targeted about 30 AI vendors in a four-day window using similar techniques.
  • GTG-50029, a single French-speaking actor that used Claude to target European political parties, media, think-tanks, and the SaaS providers used by these organizations, including by exploiting a previously undocumented WordPress re-installation race condition that made it possible to create a rogue administrator account without valid credentials, as well as by abusing an exposed search endpoint to breach a political campaign management platform and siphon sensitive data. The threat actor has also been observed deploying web shells and a browser exploitation C2 framework against other targets. Central to the attacker’s operation was a purpose-built doxxing platform named «fafsearch» that offered the ability to cross-reference individual breach dumps against exfiltrated data.

«At one end, actors used Claude conversationally: it acted as an engineering assistant in the creation of malware, phishing kits, and surveillance tooling,» Anthropic said. «Further along the spectrum, threat actors directed Claude to execute operations (such as running commands against victim networks, harvesting credentials, and exfiltrating data) with a human making each individual targeting decision (GTG-20006).»

Cybersecurity

«At the far end, operations ran autonomously, with minimal human input or supervision: these included multi-agent frameworks conducting reconnaissance, exploitation, and theft against multiple victims, in parallel, for hours or days at a time (GTG-50014, GTG-50020, GTG-50029).»

The AI company said it also identified and took down a number of influence operations in which Claude played the role of a «sub-editor or content creator» to churn out content and run them at a scale beyond what low-resourced actors could have accomplished on their own. However, Anthropic emphasized that none of these efforts amassed authentic engagement and that they were disrupted before they could even build an audience.

Some of the influence and surveillance campaign clusters flagged by Anthropic at a high level are below –

  • GTG-04001, a Russian-speaking actor in Bangui that engaged in a foreign information manipulation and interference operation in the Central African Republic to amplify pro-Russia, anti-France talking points.
  • GTG-54002, a commercial «influence-as-a-service» operation that used Claude to mass-produce and rewrite political content across about 70 fabricated news websites. The operation has been traced back to LKM Company, a France-based digital advertising agency.
  • GTG-84005, a single account that used Claude to run a commercial election manipulation platform primarily targeting users in Malaysia based on political and social factors, such as their race and religion, by posing as a defensive cyber intelligence and counter-disinformation tooling outlet. The activity has been found to share links with BBS Bilisim Teknolojileri, an Istanbul-based technology company.
  • GTG-24015, a set of four accounts that used Claude as an «editorial and news production desk» to distribute them via state media outlets like Sputnik Moldova, RIA Novosti, Sputnik en Español, Sputnik Africa, and RT’s English-language newsroom.
  • GTG-34001, a set of three Iranian state-aligned accounts that used Claude to shape public opinion, turn official government intelligence bulletins into tailored content, and disseminate the content across social media platforms.
  • GTG-54006, a sustained, automated disinformation network that used Claude to generate fabricated Bengali-language news in Bangladesh and promote the country’s Awami League party. The activity has been linked to a single actor based in Gaibandha District in Bangladesh via a set of 29 Claude accounts that were rotated to bypass platform limits and detection.
  • GTG-84006, a distributed influence operation that targeted Iranian audiences across the world with an aim to impersonate real activists and engage in live political conversations. The activity has been linked to People’s Mojahedin Organization of Iran (PMOI/MEK) and the National Council of Resistance of Iran (NCRI).
  • GTG-54004, an account used by a single actor to mass-produce Kenyan political content as part of what’s suspected to be a domestic astroturfing campaign with a pro-administration bent.
  • GTG-84002, an account used by a single actor to run a sustained influence operation against the Muslim Brotherhood, the Sudan conflict, and the United Nations accountability mechanisms.
  • GTG-54009, a commercial surveillance platform that used Claude to analyze, classify, and profile the social media activity of users in Iran and the Persian Gulf region. The activity is assessed to have been carried out by, or on behalf of, an Israeli-Singaporean commercial intelligence vendor named S2T Unlocking Cyberspace.
  • GTG-14010, a China state-aligned operation that used Claude to track, profile, and recruit Uyghurs and Uyghur armed formations in Syria. The actor has been found to use the AI model to convert conversations extracted in bulk from over 100 monitored WhatsApp groups and dozens of Telegram channels into structured Chinese-language data and «creating profiles of individuals who might be vulnerable to targeting due to financial stress, family separation, and ideological disillusionment.»
  • GTG-14020, a set of accounts likely linked to a Chinese government-aligned intelligence operation that used Claude to build Chinese-language dossiers targeting religious leaders and Chinese diaspora figures across Asia, as well as map religious venues and instruct the model to adopt «China’s standpoint.»
  • GTG-14021, a set of accounts from China-based actors that used Claude to support surveillance and transnational repression, including prompting the model to assume the role of an intelligence analyst serving China’s national security apparatus.
  • GTG-14022, a China-based «public opinion monitoring» and dissident surveillance operation that used Claude to produce government briefings that listed dissidents, activists, ethnic minority and Chinese diaspora communities, and foreign media as threats to political stability while asking it to play the role of a «senior emergency public opinion analyst serving the government of the People’s Republic of China.»
  • GTG-34007, a set of 16 accounts operated by two Iranian-nexus actors associated with paramilitary and domestic security agencies that used Claude to build a frontend for what appears to be a government-controlled surveillance case-management system, run social-network analysis over 155,216 X posts, and build domestic surveillance capabilities via a malicious Mozilla Firefox extension named «al-Najm al-thāqib» to harvest user identities from major social network platforms.
  • GTG-50027, a single account that used Claude to design a national mass interception and surveillance platform called Lakana 360 for Mali’s state intelligence service to monitor about 25 million SIM cards spanning three of the country’s national mobile operators, and generate intelligence dossiers for any phone number. The platform has a separate layer that collects call records, text messages, and voice calls across the mobile networks.
  • GTG-30004, an Iran-nexus threat actor that used Claude to develop an automated, open-source intelligence identity-profiling service targeting Israeli and Jewish diaspora organizations.
  • GTG-30005, an Iran-nexus threat actor that used Claude to gather and analyze publicly accessible data to develop targeting recommendations against U.S. naval forces in the region and build software components of a domestic mass-surveillance platform that combined automatic license-plate recognition with mobile-device identifier interception.
  • GTG-30006, an Iranian threat actor that leveraged free Claude.ai accounts to develop malware, a delivery pipeline, and a phishing portal targeting domestic Iranians. This included a bogus ESET NOD32 antivirus login page that transmits captured credentials to Telegram, a ClickFix-style Windows Run dialog lure, and geofenced delivery pages. The threat actor has also used Claude to build SECOMS64, a modular Windows implant with keylogging, screenshot capture, and Chrome credential extraction capabilities.
Cybersecurity

Elsewhere, Anthropic said it neutralized Claude misuse efforts by threat actors based in northern Yemen to develop guided weapons, two China-based operations to draft a Chinese-language specification for an anti-torpedo fire control system and build targeting software for electronic warfare, and a Russia-based operation to engineer a full-stack autonomous first-person-view (FPV) kamikaze drone swarm.

«As AI models become more widely used, providers will continue to acquire threat-relevant visibility into real-world use that even governments and intergovernmental organizations lack,» the company said. «We hope that sharing these early insights with the public helps inform governments, the industry, and the general public on the nature of these risks, and the safeguards that are necessary for ensuring the safe deployment of AI models.»

Claude Mythos de Anthropic encuentra debilidades en los algoritmos de cifrado

Los investigadores de Anthropic utilizaron Claude Mythos Preview para encontrar nuevas debilidades en dos métodos criptográficos, dijo la compañía el martes, incluido uno que está siendo considerado por el Instituto Nacional de Estándares y Tecnología para la computación tradicional y cuántica.

en un publicación de blog Al detallar el trabajo, la empresa fronteriza de inteligencia artificial lo calificó como un avance de investigación “sustancial”, pero también enfatizó que ninguno de los defectos afecta el software que se utiliza actualmente.

«Los ataques descritos en estos dos artículos son los ataques más fuertes que hemos encontrado hasta la fecha», escribió la compañía en la publicación.

Una de las debilidades encontradas fue en HALCÓNun esquema de firma digital que el NIST está revisando como parte de una búsqueda de métodos de cifrado que puedan sobrevivir a los ataques de computadoras cuánticas. Trabajando con un investigador humano, el sistema de IA encontró un atajo matemático, conocido como automorfismo no trivial, en la estructura reticular (una red matemática compleja que sustenta su seguridad) en la que se basa HAWK.

La debilidad descubierta reduce a la mitad la fuerza clave efectiva de HAWK, lo que significa que el tamaño de las claves tendría que duplicarse para mantener el mismo nivel de seguridad. Anthropic dijo que el cambio borraría gran parte de lo que hizo de HAWK un candidato atractivo en primer lugar.

Ellen Boehm, vicepresidenta senior de estrategia e innovación de IA en Keyfactor, un proveedor de gestión de criptografía e identidad digital, dijo a CyberScoop que investigaciones como la de Anthropic demuestran que el proceso de evaluación PQC del NIST está funcionando.

También dijo que la investigación «realiza la importancia de que las organizaciones tengan visibilidad de dónde se encuentra la criptografía dentro de su empresa, a qué sistemas y procesos comerciales está conectada y la necesidad de estar preparados para PQC, si aún no han elaborado un plan».

El otro defecto se encontró en una versión debilitada del Estándar de cifrado avanzado, o AES, el cifrado que adoptó el NIST en 2001 y el método más utilizado para codificar datos en tránsito. Trabajando en gran medida por su cuenta, Mythos inventó un atajo matemático denominado «Puente de Möbius». Mientras que el cifrado en el mundo real codifica los datos a través de 10 capas secuenciales o “rondas”, los investigadores estudian periódicamente una versión de prueba simplificada de siete rondas para medir los márgenes de seguridad. En ataques teóricos anteriores, los descifradores de códigos tuvieron que comparar 256 valores separados con una tabla de memoria, pero Mythos creó un atajo que eliminó ese proceso de búsqueda por completo.

Combinado con otras optimizaciones, este descubrimiento hizo que el ataque teórico más fuerte conocido contra AES de siete rondas fuera de 200 a 800 veces más rápido. El ataque es puramente teórico: requiere una cantidad imposible de datos del objetivo (más de 400 octillones de mensajes) y no puede tocar el cifrado completo de 10 rondas que protege el software cotidiano. Además, Anthropic señaló que los sistemas del mundo real siguen siendo completamente seguros.

Anthropic dijo que siguió las prácticas de divulgación estándar, notificando a los diseñadores de HAWK en junio y coordinando la publicación pública con una lista de correo del NIST, e informando de antemano a los socios gubernamentales y de la industria. También trabajó con investigadores de ETH Zurich, la Universidad de Tel Aviv y la Universidad de Haifa para crear una herramienta de prueba compartida, llamada Banco de Criptoanálisisdestinado a permitir que otros investigadores midan el rendimiento de los sistemas de IA frente a una variedad de cifrados.

Los hallazgos se producen mientras los investigadores de ciberseguridad están implementando modelos de inteligencia artificial de vanguardia para encontrar vulnerabilidades en todo tipo de software. En junio, las agencias de inteligencia de la alianza Five Eyes advirtieron que faltaban “meses” para contar con modelos avanzados de IA capaces de causar estragos en el dominio cibernético. Sin embargo, un informe reciente encontró que a pesar de la avalancha de errores descubiertos, el nivel de amenaza en Internet no ha cambiado materialmente.

Anthropic dijo que espera que las mismas capacidades de IA eventualmente se apliquen a sistemas que ya se utilizan ampliamente, lo que plantea una pregunta separada que dijo que aún no ha resuelto: cómo deberían responder los investigadores, las empresas y los gobiernos si un modelo de lenguaje descubre una falla en un sistema criptográfico que protege la infraestructura crítica.

«A medida que desarrollamos resultados criptoanalíticos cada vez más potentes, sería prudente considerar cómo deberían reaccionar los investigadores si un modelo de lenguaje descubriera vulnerabilidades en los criptosistemas donde los ataques tienen un impacto inmediato en el mundo real», escribió la compañía. «Esperamos que nuestro trabajo aquí ayude a iniciar estas conversaciones».

Boehm dijo que trabajos como el de Anthropic demuestran además que las empresas no deben dormirse en los laureles con ninguna faceta de su aparato de seguridad.

«La IA se está convirtiendo en una herramienta poderosa para muchas cosas, incluido el control de calidad del software, el desarrollo de códigos y, en este caso, el análisis criptográfico», dijo a CyberScoop. «A medida que las herramientas de inteligencia artificial se utilizan de manera más amplia y continua, aumenta la necesidad de que las empresas traten su infraestructura de confianza de manera continua y operativa en lugar de pensar en ella como un entorno estático que solo cambia cada pocos años a medida que se lanzan nuevos algoritmos criptográficos».

Greg Otto

Escrito por Greg Otto

Greg Otto es el editor en jefe de CyberScoop y supervisa todo el contenido editorial del sitio web. Greg ha dirigido una cobertura de ciberseguridad que ha ganado varios premios, incluidos los de la Sociedad de Periodistas Profesionales y la Sociedad Estadounidense de Editores de Publicaciones Empresariales. Antes de unirse a Scoop News Group, Greg trabajó para Washington Business Journal, US News & World Report y WTOP Radio. Tiene una licenciatura en periodismo televisivo de la Universidad de Temple.

Claude AI acaba de descifrar un esquema de prueba poscuántico y encontró un ataque AES de 7 rondas más rápido – CYBERDEFENSA.MX

Antrópico dice Vista previa de Claude Mythos ayudó a obtener un ataque de recuperación de claves de extremo a extremo contra HAWK-256 y una aceleración de 200 a 800 veces para un ataque contra AES-128 de siete rondas.

El ataque HAWK explota una simetría no utilizada anteriormente en la red detrás del esquema de firma. La implementación lanzada de Anthropic ofrece un tiempo de ejecución esperado de un extremo a otro de aproximadamente tres horas y 42 minutos en un servidor de 96 núcleos. El resultado de AES elimina un paso de adivinación de 256 vías de un ataque de encuentro en el medio existente.

Anthropic dijo que ninguno de los resultados afecta los sistemas de producción. HAWK sigue siendo candidato en un proceso de estandarización poscuántica del Instituto Nacional de Estándares y Tecnología (NIST), y el código de recuperación público solo apunta al parámetro más pequeño HAWK-256.

El resultado del Estándar de cifrado avanzado (AES) se aplica a siete de las diez rondas de AES-128 y aún requiere una cantidad poco práctica de textos sin formato elegidos. La compañía dijo que, como resultado, no es necesario cambiar el software de producción.

antrópico publicó los hallazgos junto con dos artículos técnicos y artefactos de reproducibilidad. La compañía dijo que Mythos Preview realizó en gran medida la investigación por sí mismo, y que los humanos proporcionaron la dirección del proyecto, los recursos informáticos y la verificación exhaustiva.

Una simetría escondida en la red de HAWK

HAWK es el único esquema basado en celosía entre los nueve candidatos que el NIST avanzó a la tercera ronda de su proceso adicional de firma digital poscuántica en mayo de 2026. Sus conjuntos de parámetros de nivel de seguridad NIST son HAWK-512 y HAWK-1024; HAWK-256 es un parámetro de desafío proporcionado como un objetivo criptoanalítico.

La recuperación directa de claves HAWK es una instancia del módulo de búsqueda Lattice Isomorphism Problem (smLIP). Un atacante debe recuperar una transformación oculta entre dos redes.

A artículo de Daniël van Gent y Ludo Pulles demostró que un automorfismo no trivial, una simetría que preserva la red, reduciría la recuperación de la clave HAWK a encontrar un vector corto en una red de aproximadamente la mitad de la dimensión original.

Ese trabajo abrió la vía del ataque, pero los autores dijeron que no afectó a HAWK. Anthropic dice que Mythos Preview encontró el automorfismo adicional necesario para explotar el camino.

Ciberseguridad

El resultado Ataque HAWK-n construye lo que los investigadores llaman una red de cociclo τ a partir de la clave pública. Luego utiliza la reducción y el tamizado de la red para recuperar vectores cortos antes de reconstruir una base secreta que pueda firmar mensajes para la clave pública original.

antrópico implementación liberada verifica la clave recuperada firmando un mensaje y verificándolo con la implementación de referencia del NIST. No recupera la semilla de clave secreta original de 96 bytes. En cambio, produce una clave decodificada de 592 bytes que contiene material de firma funcionalmente equivalente.

El código publicado de Anthropic solo admite HAWK-256 y rechaza todas las entradas que no sean HAWK-256. El repositorio incluye dos claves públicas que Anthropic dice haber atacado con éxito. También admite la generación y prueba de claves HAWK-256 nuevas.

Anthropic estima que el factor de trabajo de recuperación clave esperado del HAWK-256 cae de 264 a 238. En un anuncio del foro NIST el mismo díadijo que la estimación del recuento de puertas cae de 2150 a 2108 para HAWK-512 y de 2288 a 2182 para HAWK-1024. Ambos parámetros más amplios siguen siendo poco prácticos de atacar.

A partir de esta revisión, el registro público no muestra si el NIST o los remitentes de HAWK cambiarán los parámetros del esquema, las afirmaciones de seguridad o la posición en el proceso de estandarización en respuesta a esas estimaciones más bajas, en todo caso.

El ataque sigue siendo exponencial. No es una ruptura de tiempo polinomial de HAWK, y Anthropic dijo que no se extiende a otros candidatos de firma del NIST ni a la criptografía reticular en general.

Anthropic dijo que Mythos Preview desarrolló y verificó el resultado durante aproximadamente 60 horas en un entorno de múltiples agentes. Un investigador humano proporcionó orientación ocasional sobre la gestión de proyectos, pero no era un especialista en criptografía reticular. La empresa estimó el coste de la interfaz de programación de aplicaciones (API) en unos 100.000 dólares.

Más rápido, pero aún poco práctico

El segundo resultado apunta al AES-128 reducido de diez rondas a siete. El estudio de cifrados de ronda reducida es una práctica criptoanalítica estándar porque mide cuánto margen de seguridad queda antes de que un ataque alcance su construcción completa.

El ataque supone que un adversario puede obtener alrededor de 2105 textos claros seleccionados cifrados bajo una clave fija desconocida. Ese requisito por sí solo lo sitúa muy lejos del uso en el mundo real.

Los ataques anteriores de encuentro en el medio intercambian memoria por cálculo almacenando estados de cifrado intermedios y haciendo coincidir cálculos realizados desde extremos opuestos del cifrado. Una etapa del ataque anterior requirió probar 256 valores posibles antes de buscar en la tabla.

Mythos desarrolló una huella digital invariante que los antrópicos llaman Puente de Möbius. Debido a que la huella digital no cambia en ese valor estimado, el ataque puede eliminar la enumeración de 256 vías. Después de tener en cuenta el costo de la transformación y otras optimizaciones, Anthropic estima que el ataque AES-128 de siete rondas es de 200 a 800 veces más rápido, dependiendo de cómo se mide el tiempo de ejecución.

el acompañante papel AES presenta la construcción matemática, mientras que la artefacto liberado proporciona código para cada experimento citado en el artículo.

El código de Anthropic realiza una recuperación completa de la clave de caja negra contra un cifrado más pequeño tipo AES con una clave de 24 bits. Para AES-128 real de siete rondas, mide las entradas de mesa individuales y los candidatos en línea. Implementaciones separadas de C, Python y Rust prueban las afirmaciones de los componentes, y Anthropic proyecta esas medidas para el ataque completo. No ejecuta la recuperación AES-128 completa de principio a fin.

El resultado práctico es más limitado de lo que podrían implicar los nombres HAWK y AES. La recuperación completa de HAWK tiene como objetivo HAWK-256, un parámetro de desafío en lugar de cualquiera de los conjuntos de parámetros de nivel de seguridad NIST. Para el AES-128 de siete rondas, Anthropic proyecta el costo completo del ataque a partir de las mediciones de los componentes, y el ataque sigue siendo inviable a una escala realista.

La compañía dijo que el modelo inicialmente se negó a participar, insistiendo en que era imposible mejorar AES. Anthropic publicó las contundentes indicaciones de seguimiento del investigador, con errores tipográficos y todo, que impulsaron al modelo a seguir buscando.

Ciberseguridad

Anthropic dijo que Mythos Preview encontró el puente Möbius después de unos tres días y varios cientos de millones de tokens de salida. Refinó el método durante los días siguientes y finalmente generó aproximadamente mil millones de tokens de salida.

El mayor costo fue humano. La ejecución del modelo costó aproximadamente 100.000 dólares en uso de API, pero los investigadores dedicaron varios cientos de horas a comprobar el método. Anthropic dijo que dos investigadores tardaron casi un mes en llegar a estar seguros de que era correcto. En opinión de Anthropic, la verificación era el cuello de botella visible.

Las revelaciones siguen a la publicación del 20 de julio de Banco de Criptoanálisisun punto de referencia de 191 tareas desarrollado por investigadores de ETH Zurich, Anthropic, la Universidad de Haifa, Technische Universität Berlin y la Universidad de Tel Aviv. Cinco modelos rompieron entre el 65% y el 86% de sus esquemas más fáciles de primer nivel y de seis a 12 esquemas completos en su segundo nivel.

Ese punto de referencia evaluó Mythos 5, que Anthropic describe como la última actualización de Mythos Preview. La divulgación de HAWK y AES nombra específicamente Mythos Preview.

A partir del 29 de julio de 2026, el NIST continuó incluyendo a HAWK como candidato de tercera ronda. El anuncio de Anthropic en el foro NIST agradeció al equipo HAWK por ayudar a verificar el resultado y brindar comentarios, pero no dijo si eso implicó revisar la prueba, ejecutar el artefacto público o ambas cosas.

El hilo público no contenía respuestas cuando se revisó, y The Hacker News no localizó una reproducción independiente de la recuperación HAWK-256 de Anthropic durante esta revisión.

Un hacker usa Claude como ayudante para extraer datos sensibles de las autoridades mexicanas – CYBERDEFENSA.MX

Un atacante se ha servido del modelo de gran lenguaje Claude de Anthropic como ‘copiloto’ para realizar un hackeo masivo contra instituciones gubernamentales de México. Así lo revelado la compañía de ciberseguridad israelí Gambit Security.

Así, Claude ayudó a identificar vulnerabilidades, escribir scripts de explotación (como escaneos de Nuclei) y automatizar la exfiltración de datos. 

Gracias a su técnica de persuasión el cibermalo consiguió sustraer 150 GB de datos sensibles de las autoridades mexicanas, afectando a 195 millones de identidades en total.

Entre las instituciones afectadas estarían el SAT (Servicio de Administración Tributaria), al INE (Instituto Nacional Electoral), y varios gobiernos estatales como Jalisco y Michoacán, según señala la empresa de ciberseguridad. 

Claude no fue el único GPT que contribuyó como ‘ayudante’ para el amigo de lo ajeno. El atacante también utilizó GPT-4.1 de OpenAI para analizar la información obtenida.

Medidas tomadas

Por su parte, desde Anthropic han confirmado que detectaron el abuso, bloquearon las cuentas involucradas y usaron los patrones del ataque para reforzar las defensas en sus modelos más recientes, como Claude Opus 4.6.

En noviembre del año pasado la empresa de IA ya reveló que actores de amenazas vinculados a China habían usado Claude Code en una campaña de espionaje digital dirigida a casi 30 organizaciones en todo el mundo. 

Pese a la detallada investigación de Gambit Security, tanto el SAT como el INE han negado categóricamente el hackeo, afirmando que sus sistemas no presentan evidencia de compromiso.

La falla de Claude Cowork podría permitir que el agente AI escape de su máquina virtual y acceda a archivos de Mac – CYBERDEFENSA.MX

Investigadores de ciberseguridad han descubierto una vulnerabilidad de escape de sandbox en Anthropic Claude Cowork eso hace posible salir de los límites de una máquina virtual (VM) de Linux dentro de la cual se ejecuta el agente para leer o escribir archivos en cualquier lugar de la Mac.

Accomplish AI, que compartió detalles de la vulnerabilidad con The Hacker News antes de su publicación, dijo que alrededor de 500.000 usuarios de macOS que ejecutaban sesiones locales de Cowork se vieron afectados antes de que se parcheara. ha sido nombrado en clave Raíz compartida.

«Conectamos una carpeta a una nueva sesión de Claude Cowork, enviamos un mensaje corto y vimos al agente escapar de la zona de pruebas», dijo Oren Yomtov, investigador principal de seguridad de Accomplish AI, dicho. «Desde el interior de la máquina virtual, llegó al host Mac y leyó y escribió archivos por todas partes, muy fuera de la carpeta que habíamos conectado, sin solicitar permiso en ninguna parte».

Con este nivel de acceso, el agente puede acceder a cualquier dato almacenado en la Mac a través de la cuenta del usuario, incluidas claves SSH, credenciales de la nube y otra información valiosa.

Tras una divulgación responsable, Anthropic cerró el informe como informativo sin publicar una solución. Dicho esto, la última versión de Cowork utiliza de forma predeterminada la ejecución en la nube, lo que soluciona el problema. Pero los usuarios que optan por ejecutar el agente localmente todavía están expuestos al problema.

Ciberseguridad

La aplicación de escritorio macOS de Claude Cowork se ejecuta como el usuario que ha iniciado sesión en el sistema. El trabajo real relacionado con el agente, por otro lado, ocurre en una máquina virtual Linux creada a través de Apple. Marco de virtualización. Cada sesión tiene su propio usuario desechable sin privilegios, junto con un filtro de Modo de Computación Segura (seccomp) para el sandboxing de aplicaciones. Las carpetas conectadas por el usuario se comparten en la VM mediante un demonio raíz llamado coworkd.

«Un detalle importa más que el resto: el sistema de archivos del host se comparte en esa VM de lectura y escritura», explicó Yomtov. «Todo el host ‘/’ está montado de modo que solo el invitado raíz dentro de la VM pueda verlo, en /mnt/.virtiofs-root».

Debido a que todo el sistema de archivos del host está montado en la máquina virtual del agente con privilegios de lectura y escritura, cualquier ruta a la raíz del invitado puede otorgar al agente acceso al host subyacente, escapando efectivamente del entorno limitado.

Esto implica cargar el subsistema de edición de paquetes de control de tráfico (tc) «act_pedit» del kernel de Linux en un espacio de nombres de usuario sin privilegios y explotar CVE-2026-46331 en el kernel invitado, una falla recientemente revelada llamada pedit COW, para obtener la raíz invitada. Desde allí, el agente puede acceder a todo el host («https://thehackernews.com/») con privilegios elevados, lo que le permite leer o escribir archivos desde y hacia el sistema de archivos de Mac como usuario de escritorio conectado.

Or Hiltch, cofundador y CTO de Accomplish AI, dijo a The Hacker News que la creación de espacios de nombres de usuarios y redes le da a la sesión CAP_NET_ADMIN dentro de su espacio de nombres de red privada, lo que le permite realizar diversas operaciones relacionadas con la red.

«Esa capacidad proporciona acceso a la ruta vulnerable del kernel tc/act_pedit utilizada por pedit COW», añadió Hiltch. «Los espacios de nombres no son el exploit; ponen su prerrequisito normalmente privilegiado a disposición de un usuario normal».

El desarrollo adquiere importancia ante las revelaciones de que los modelos de OpenAI lograron salir de su entorno aislado durante una prueba de seguridad que resultó en la violación de la infraestructura de producción de Hugging Face en su intento de engañar al punto de referencia ExploitGym en el que estaban siendo calificados.

Ciberseguridad

«act_pedit es un error en una categoría», dijo Yomtov. «El subsistema net/sched de Linux lanza esta forma exacta de escalada de privilegios en una cadencia regular: un módulo autocargable, una ruta de configuración que un usuario sin privilegios puede alcanzar, un error de memoria al final. Parche este y habrá arreglado este. La cadena se rearma en el siguiente, con todo lo que está encima del kernel intacto».

«Y el siguiente siempre está por llegar. En cualquier momento dado, es probable que haya un error de escalada de privilegios al que todavía está expuesto, a veces solucionado en el sentido anterior pero aún no en su imagen, a veces aún no solucionado en ninguna parte, con un exploit funcional que funciona en cuestión de horas. Este no es un problema que se solucione más rápido. Estás estructuralmente un error detrás, todo el tiempo».

Para mitigar la amenaza, es esencial deshabilitar espacios de nombres de usuarios sin privilegiosevite hacer que el filtro seccomp sea demasiado permisivo, detenga la carga automática de módulos y restrinja el uso compartido de todo el host en la máquina virtual.

«Aléjelo a las carpetas que realmente estaban conectadas en lugar de a todas /, o al menos móntelo como de solo lectura, y ejecute coworkd con ProtectSystem=strict en su propio espacio de nombres de montaje para que no vuelva a ejecutar archivos binarios que un usuario de sesión pueda envenenar», dijo Accomplish. «Entonces, incluso una raíz invitada completa no tiene nada donde aterrizar, los dos últimos pasos de la cadena no tienen adónde ir».

Los investigadores dicen que Claude por la falla de Chrome permite que las extensiones no autorizadas activen lecturas de Gmail – CYBERDEFENSA.MX

Cualquier otra extensión del navegador que pueda ejecutar un script en claude.ai aún puede activar tareas de Claude para Chrome dirigidas a su Gmail, su último documento de Google y sus comentarios, y su Calendario.

Tanto esto como ClaudeBleed necesitan una extensión maliciosa que ya pueda ejecutar un script en claude.ai; la diferencia es el alcance. Anthropic restringió el camino arbitrario en mayo como parte de su respuesta a la claude sangrar defecto, agrupar a las personas que llaman externamente en un conjunto fijo de tareas, pero Seguridad múltiple dice que la brecha aún está abierta en v1.0.80, la versión actual, ocho versiones después.

Si ejecuta Claude para Chrome y cualquier otra extensión que pueda tocar claude.ai, está dentro del alcance. En el modo predeterminado «preguntar antes de actuar», la tarea falsificada aún aparece en un cuadro de aprobación en el que debe hacer clic.

Si activó «Actuar sin preguntar», el modo de automatización sin intervención, se ejecuta sin ningún aviso. La medida más rápida es desactivar «Actuar sin preguntar» y revisar cualquier extensión con permiso para leer o cambiar datos en claude.ai. Eso restaura el paso de aprobación pero no elimina la ruta de clic falsificada y no hay parche a partir del 14 de julio.

The Hacker News descomprimió la versión actual y confirmó que ambos mecanismos permanecen en la versión 1.0.80.

El gatillo acepta un clic falsificado.

Después claude sangrarAnthropic dejó de permitir que la página le entregara a Claude cualquier texto que quisiera y encajonó a las personas que llamaban externas en nueve ID de tareas fijas integradas en el paquete de extensión.

Tres son indicaciones de práctica de incorporación, tres impulsan DoorDash, Salesforce y Zillow, y las últimas tres, usecase-gmail, usecase-gdocsy usecase-calendarson los que leen tu correo, tu último documento y sus comentarios, y tu calendario. La lista de permitidos es una mejora real. El paje ya no puede poner palabras en boca de Claude.

Ciberseguridad

El punto débil es lo que aprieta el gatillo. Un script de contenido en la extensión escucha en claude.ai un clic en un elemento específico (#claude-onboarding-button), lee su data-task-idy si el ID es una de las nueve tareas incluidas en la lista permitida, envía a la extensión un open_side_panel mensaje que lo lleva. El panel se abre con el mensaje coincidente cargado. Lo que el manejador nunca verifica es event.isTrustedla bandera del navegador que le indica a un usuario real que haga clic en uno de los scripts enviados.

Por lo tanto, cualquier extensión cuyo script de contenido pueda llegar al DOM en claude.ai puede crear el elemento, establecer el ID de la tarea y enviar un clic sintético. La extensión lo trata como un grifo genuino. Manifold demostró el disparador con seis líneas pegadas en la consola claude.ai, con isTrusted: false en los registros que confirman que se respetó el clic falso.

Con el control del navegador activado, el valor predeterminado una vez que finaliza la incorporación, ese clic falsificado carga el usecase-gmail tarea en el panel. En el modo predeterminado, todavía hay un cuadro de aprobación entre esa lectura y cualquier lectura real, y el usuario debe hacer clic en él. Manifold califica la falla CVSS como 7.7 Alta en ese modo y 9.6 Crítica una vez que un usuario ha habilitado «Actuar sin preguntar», donde la misma tarea se ejecuta silenciosamente.

La solución de una sola línea, dicen los investigadores, rechaza los clics sintéticos en la parte superior del controlador. No se ha enviado.

Un defecto más silencioso se encuentra debajo

El segundo problema no es ni remotamente abordable hoy en día, pero es lo que elimina el paso de aprobación si alguna vez otro defecto lo expone. Cuando el panel lateral de Claude se carga con ?skipPermissions=true en su URL, arranca directamente en skip_all_permission_checks y comienza a actuar sin preguntar.

Sin gesto, sin pantalla de consentimiento. Aparece una pancarta roja que advierte que Claude ahora puede realizar la mayoría de las acciones en línea, pero solo después de que la sesión privilegiada ya se esté ejecutando. La pancarta te cuenta lo que pasó. Eso no impide que esto suceda.

Por ahora, esa URL solo puede ser creada por la propia extensión, por lo que no existe una ruta remota directa. Un error futuro que permita que un contexto con menos privilegios establezca ese parámetro podría convertir el truco del clic falsificado en una lectura de cuenta completamente silenciosa. Esa ruta podría quedar expuesta por un controlador de mensajes que acepta URL, una regresión de creación de paneles o una falla XSS en la página de opciones. La solución de Manifold es dejar de leer el modo de permiso desde la URL e iniciar el panel en modo de solicitud cada vez.

Manifold asigna el ataque funcional al Top 10 de OWASP para aplicaciones LLM como inyección de aviso indirecto, ya que el atacante activa uno de los nueve avisos permitidos de la extensión con un clic falso y el riesgo de ejecución silenciosa es una agencia excesiva. Ambos reproducen si el panel lateral está configurado en Opus, Sonnet o Fable. El error está en la extensión, no en el modelo.

Reportado en mayo, todavía en el código de envío.

Manifold informó ambos problemas el 21 de mayo en la versión 1.0.72. Anthropic los reconoció al día siguiente y luego cerró ambos. Cerró el informe sobre el clic falsificado basándose en que el problema subyacente del límite de confianza ya había sido rastreado en el informe anterior de ClaudeBleed, que Antrópico dijo «permanece abierto en espera de una solución completa».

Ciberseguridad

Cerró el informe de URL como informativo, argumentando que la extensión solo establece el parámetro para tareas que el usuario ya le indicó que ejecutara sin supervisión.

Sin embargo, el informe interno destinado a cubrir esa solución se marcó como resuelto antes del 9 de junio, y ocho versiones después, el código vulnerable no se ha movido: Manifold verificó la versión 1.0.80 el 7 de julio y encontró que el controlador de clic del script de contenido y la inicialización del panel lateral byte por byte son idénticos a la versión 1.0.72 que informó por primera vez.

Anthropic no había publicado una respuesta pública a los hallazgos de Manifold hasta el 14 de julio, y si «resuelto» significa que todavía hay una solución por llegar o que el riesgo restante no la justifica, no es algo que nadie fuera de la empresa pueda decir.

El escaneo lo confirmó. The Hacker News sacó la versión 1.0.80 del Tienda web de Chromeactualizado el 7 de julio y disponible para todos los suscriptores pagos, lo descomprimió y revisó los 90 paquetes de JavaScript: el controlador de clics de incorporación se activa con cualquier clic coincidente sin event.isTrusted protector y en el panel lateral se lee skipPermissions desde su propia URL y cambia a skip_all_permission_checks cuando esté configurado.

A partir de esa fecha, no encontramos ningún CVE para ninguno de los problemas ni ningún aviso de Anthropic.

Nada de esto es nuevo para la extensión. Una falla separada parcheada a principios de este año permitía que cualquier sitio web le inyectara indicaciones silenciosamente, y ClaudeBleed comenzó de la misma manera a fines de abril, cuando LayerX descubrió que Claude para Chrome confiaba en el origen claude.ai en lugar de verificar qué script realmente estaba hablando con él, expulsó al asistente de una extensión de permiso cero y encontró que la primera mitigación de Anthropic estaba incompleta.

LayerX llamó a ClaudeBleed un problema de ayudante confundido, un programa con autoridad real que actúa para la persona que llama equivocada. Claude Code ha mostrado una versión del mismo error: un repositorio hostil podría filtrar las claves API de Anthropic de un desarrollador. Anthropic llama a la extensión. una betay está abierto a todos los suscriptores pagos de Claude.

Coloque un agente de IA en su navegador con sus cuentas ya iniciadas, y otra extensión que pueda alcanzarlo podrá impulsar las capacidades que expone Claude, dentro del conjunto de tareas fijas y cualquier modo de aprobación que haya establecido.

Ambos hallazgos debilitan el mismo límite: Claude acepta un clic generado por un script como su intención, y su estado de permiso se puede establecer desde una URL. Ocho lanzamientos después, ese límite sigue donde lo dejó Manifold en mayo.

Anthropic restaura Claude Fable 5 después de que Estados Unidos levantara los controles de exportación vinculados al jailbreak – CYBERDEFENSA.MX

Antrópico es poner Claude Fábula 5 nuevamente en línea en todo el mundo. En 30 de junioel Departamento de Comercio de Estados Unidos levantó los controles de exportación que había impuesto a Fable y su hermano Mythos 5, más controlado, aproximadamente dos semanas y media antes.

Fable 5 regresa a los usuarios el miércoles 1 de julio en Claude.ai, Claude Platform, Claude Code y Claude Cowork.

Los controles de exportación restringen quién puede recibir o utilizar una tecnología. La orden del 12 de junio le ordenó a Anthropic que cortara ambos modelos para cualquier ciudadano extranjero, dentro o fuera de los Estados Unidos, incluido su propio personal no ciudadano.

La regla entró en vigor de inmediato y la compañía no tenía una forma confiable de verificar la nacionalidad de cada usuario en tiempo real, por lo que cerró ambos modelos para todos.

El detonante fue un jailbreak: un aviso que hace que un modelo eluda sus reglas de seguridad. Los investigadores de Amazon encontraron uno en Fable 5. Según Anthropic, el mensaje hizo que el modelo señalara algunas fallas de software y, en un caso, escribiera código que mostrara cómo se podía abusar de una falla.

Anthropic restó importancia al hallazgo. Dice que las mismas solicitudes también funcionan en muchos modelos más débiles, incluido su propio Claude Opus 4.8, el GPT-5.5 de OpenAI y el Kimi K2.7 de China. La compañía llama al comportamiento señalado un trabajo de seguridad defensiva de rutina, no una supercapacidad oculta.

El gobierno y el socio que informó sobre la fuga lo consideraron lo suficientemente grave como para justificar controles de emergencia.

Ciberseguridad

Para resolver la preocupación, Anthropic entrenó un nuevo filtro de seguridad, llamado clasificadorque busca la técnica exacta en el informe y la bloquea. La compañía dice que ahora detiene esa técnica en más del 99% de los intentos, según el artículo del 30 de junio. Las solicitudes bloqueadas se entregan al Opus 4.8 más débil y se le informa al usuario. La compensación es que habrá más falsas alarmas en la codificación y depuración normales.

Mythos 5, el mismo modelo subyacente con menos barandillas de seguridad, mantiene una correa más corta. El acceso regresó el 26 de junio para aproximadamente 100 empresas y agencias federales estadounidenses que defienden la infraestructura crítica. Anthropic dice que todavía está trabajando con el gobierno para ampliar el acceso.

El secretario de Comercio, Howard Lutnick, quien aprobó la reversión, dijo que su departamento había pasado dos semanas revisando los modelos con Anthropic. En su carta, la compañía acordó buscar problemas de seguridad por su cuenta, coordinar lanzamientos futuros e informar cualquier uso malicioso que detecte.

Según se informa, las negociaciones fueron dirigidas por el cofundador Tom Brown y no por el director ejecutivo Dario Amodei, quien ha chocado con la administración durante gran parte del año.

La pelea fue complicada desde el principio. Múltiples informes, incluido el de The Wall Street Journal, dijeron que la investigación de Amazon y las preocupaciones del director ejecutivo Andy Jassy ayudaron a impulsar el pedido original. Ex zar de la IA David Sacos acusó a Anthropic de haber «priorizado la oferta continua del modelo de consumo por encima de la seguridad». Otros lo interpretan como una sobrecorrección.

El investigador de gobernanza de IA de la Universidad de Sydney, Francesco Bailo, dijo a Al Jazeera que la reversión parecía como si el gobierno hubiera admitido que había ido demasiado lejos, y un grupo de líderes de seguridad había firmado una carta abierta pidiendo que se levantaran los controles.

Sobre todo ello flotaba la competencia. La pausa se produjo justo cuando los modelos chinos de código abierto baratos y capaces estaban ganando terreno, y varios ejecutivos advirtieron que congelar los modelos estadounidenses les daba a los rivales tiempo libre para ponerse al día.

Anthropic también propone algo de lo que carecía la industria: una forma compartida de clasificar qué tan peligroso es realmente un jailbreak. Con Amazon, Microsoft, Google y otros socios, quiere calificar a cada uno en cuatro aspectos:

  • Ganancia de capacidad: hasta qué punto el jailbreak lleva a un usuario más allá de las herramientas que ya tiene.
  • Amplitud: cuántos ataques diferentes desbloquea el mismo truco.
  • Facilidad de armamento: cuánta habilidad y esfuerzo se necesita para convertirlo en un ataque real.
  • Descubribilidad: Qué fácil es encontrar o copiar el truco.

Para los peores casos, como un jailbreak que permite ataques a redes eléctricas o bancos, Anthropic dice que comenzará a implementar correcciones en el momento en que se confirme la gravedad, y está formando un equipo para observar los informes de jailbreak las 24 horas del día.

Ciberseguridad

También abrió un programa hackerone para que los investigadores informen sobre nuevas fugas de Fable 5, y prometió al gobierno de EE. UU. acceso temprano para probar futuros modelos fronterizos antes de su lanzamiento.

Anthropic no es el único laboratorio en esta posición. Días antes, OpenAI presentó GPT-5.6 a un pequeño grupo aprobado por el gobierno en lugar de al público, citando la misma preocupación de doble uso: un modelo lo suficientemente bueno como para ayudar a los defensores a corregir errores también es lo suficientemente bueno para ayudar a los atacantes a encontrarlos.

El riesgo no es hipotético. A principios de esta primavera, Anthropic probó un modelo anterior de Mythos que encontró y explotó errores de día cero en todos los principales sistemas operativos y navegadores bajo comando, incluida una falla de 27 años en OpenBSD. Su equipo rojo convirtió errores recién revelados en exploits funcionales en menos de un día.

La crisis inmediata ha terminado. La pregunta más importante no es. A orden ejecutiva del 2 de junio creó un camino voluntario para que las empresas revisen los modelos de frontera antes de su lanzamiento. También estableció un punto de referencia clasificado para decidir qué modelos cuentan como «cubiertos», al tiempo que descarta cualquier licencia obligatoria para enviar uno. Fable 5 nunca pasó por ese camino.

En cambio, el gobierno recurrió a controles de exportación. Ésa es la cuestión: cuando Washington quiere avanzar rápidamente sobre un modelo fronterizo, todavía no tiene ningún proceso vinculante, sólo procesos improvisados.

Claude Chat Abuse, NastyC2 npm Packages, Device-Code Phishing + 25 More Stories – CYBERDEFENSA.MX

The internet did not break this week. It got used exactly as designed, which is worse.

Searches were siphoned through shady browser add-ons. AI chat links turned into malware delivery paths. macOS attacks ran in memory and left almost nothing behind. Cloud agents looked like helpers until attackers treated them like open shells.

Add exposed edge gear, poisoned packages, cash courier scams, stealers, loaders, and phishing that barely bothers pretending anymore. Here’s the full mess.

  1. DoH lands in Windows Server 2025

    Microsoft has announced that DNS-over-HTTPS (DoH) for Windows DNS Server is generally available on Windows Server 2025 for client-to-server DNS traffic. «With general availability, organizations can now deploy encrypted and authenticated client-to-resolver DNS traffic directly within their existing on-premises DNS infrastructure,» the company said. «The goal is to help improve privacy, reduce spoofing risk, and advance Zero Trust DNS without requiring a new resolver architecture. Enabling DoH on Windows DNS Server introduces encrypted communication for supported clients over HTTPS while preserving compatibility with most existing DNS deployments. Organizations can expect DoH traffic between DoH clients and Windows DNS Server to be encrypted via TLS, DNS queries to be transported as HTTPS requests, existing DNS functionality to continue operating as expected, and mixed environments, encrypted and traditional DNS, to be supported.»

The lesson this week is not subtle. Trust is the attack surface now. The browser extension, the AI chat link, the OAuth flow, the coding agent, the package install, and the “known good” cloud helper. Attackers are not always breaking down the door anymore. They are finding the doors we already propped open for convenience.

That means defense has to get less romantic about defaults. Watch the tools users trust, not just the files they download. Audit agents like accounts. Treat packages like code execution. Treat links from trusted platforms like links, not proof of safety. The internet did not collapse this week. It reminded us that “legitimate” is not the same as safe.

Worm Code Leaked, AI Agent Phished, Claude Action Patch + 28 New Stories – CYBERDEFENSA.MX

It’s been one of those weeks. You expect the usual noise: recycled malware, sloppy attacks, another easy target getting hit. Instead, there’s a supply chain attack kit in a public repo, a $5,000-a-month RAT that clones browsers, and research showing AI agents can be tricked into leaking real credentials.

The bigger problem is how polished this all looks now. Mule networks run like SaaS. Deepfake KYC bypass is sold as a feature. Endpoint tools can be quietly weakened using built-in OS settings, with no exploit needed.

Here’s the full list of threats, tools, flaws, and updates worth knowing.

  1. 3.3B identity records exposed

    A new analysis from Flashpoint has revealed that «more than 11.1 million devices were infected with infostealers last year, fueling a supply of over 3.3 billion stolen credentials, session cookies, cloud tokens, and other forms of identity data now circulating across illicit markets.» There are over 30 unique infostealer strains actively listed for sale across illicit marketplaces, forums, and underground communities, indicating the «scale and accessibility of the modern malware-as-a-service ecosystem.» Lumma, Acreed, Rhadamanthys, Vidar, and StealC were the most prolific stealers in 2025. India, Brazil, Indonesia, Vietnam, the Philippines, and the U.S. were the top six countries affected by stealer malware during the same period.

The throughline is simple: attackers do not always need exploits. They need patience, stolen credentials, trusted tools, and one policy setting nobody has checked since the last reorg. The perimeter is not the real problem anymore. The problem is everything inside it that still trusts by default.

Same old lesson: audit what your agents can access, treat every identity in the pipeline as a risk, and check what your browser extensions are sending home. See you Thursday.

Anthropic lanza Claude Fable 5, su IA más poderosa hasta el momento, con salvaguardias cibernéticas – CYBERDEFENSA.MX

El 9 de junio, Antrópico lanzado Claude Fábula 5el modelo más capaz que jamás haya fabricado, está disponible de forma generalizada. También hizo algo inusual: envió un modelo como dos productos, divididos no por capacidad sino por una capa de clasificadores de seguridad.

Fábula 5 sale al público. Su gemelo, Claude Mythos 5, el mismo modelo subyacente con las salvaguardas cibernéticas eliminadas, permanece restringido a un grupo examinado de ciberdefensores y operadores de infraestructura crítica.

Anthropic considera que Mythos 5 es el modelo de ciberseguridad más sólido del mundo.

La diferencia práctica es la siguiente: Fable 5 enruta las solicitudes cibernéticas, biológicas, químicas y de destilación al Claude Opus 4.8, más débil, mientras que Mythos 5 mantiene las capacidades cibernéticas disponibles para los usuarios examinados. Ambos modelos cuestan 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, menos de la mitad del precio del Mythos Preview anterior, y Fable 5 ya está disponible a través de la API de Claude.

Está incluido en los planes Pro, Max, Team y Enterprise basados ​​en asientos sin costo adicional hasta el 22 de junio y luego pasa a créditos de uso.

Cómo funcionan los clasificadores cibernéticos de Fable 5

La división existe porque los modelos de clase Mythos encuentran y explotan vulnerabilidades de software lo suficientemente bien como para que, en el marco de Anthropic, entregar esa capacidad al público en general sin controles daría a los atacantes un gran beneficio.

El mecanismo es un conjunto de clasificadores: sistemas de IA separados que vigilan el mal uso y los intentos de jailbreak. Cuando una solicitud lo hace tropezar, Fable 5 no se niega. La respuesta se entrega a Opus 4.8 y se le informa al usuario que se produjo la transferencia. De las categorías marcadas, la destilación es la que destaca: significa extraer las capacidades de un modelo para entrenar un modelo competidor, que Anthropic bloquea para evitar que las habilidades cercanas a la frontera se filtren sin salvaguardias adjuntas.

Ciberseguridad

El clasificador de ciberseguridad es el amplio. Anthropic lo diseñó para bloquear no sólo el desarrollo de exploits sino también las tareas cibernéticas ofensivas en general: reconocimiento, descubrimiento, movimiento lateral, los pasos de agencia que conforman un ataque real.

En una evaluación interna ejecutada con Fable 5 configurado para bloquear en lugar de retroceder, y que no intentó evadir las salvaguardas, los clasificadores impidieron que el modelo progresara en esas tareas. Un socio externo descubrió que Fable 5 cumplió con cero solicitudes dañinas de un solo turno sobre planificación de ataques cibernéticos, desarrollo de exploits o evasión de defensa, resistiendo 30 técnicas públicas diferentes de jailbreak.

La compensación son los falsos positivos. Anthropic ajustó las medidas de seguridad de manera conservadora para realizar envíos rápidos, por lo que a veces detectan solicitudes inofensivas. La compañía dice que el respaldo se activa en menos del 5% de todas las sesiones, por lo que durante más del 95%, Fable 5 se comporta como el Mythos 5 cibernético sin restricciones. Esa cifra cubre todos los respaldos, incluidos los bloques genuinos, por lo que limita la interrupción total en lugar de medir la tasa de falsos positivos por sí solo. Anthropic dice que reducirá las salvaguardas y eliminará los falsos positivos después del lanzamiento.

En cuanto a la solidez, las cifras son específicas. Una recompensa por errores externos duró más de 1000 horas y no produjo ningún jailbreak universal, ni un aviso ni un arnés que elimine las salvaguardias por completo. Los equipos rojos externos tampoco encontraron ninguno en tareas de agente de larga duración, con una advertencia que Anthropic afirma claramente: el Instituto de Seguridad de IA del Reino Unido avanzó hacia un jailbreak universal dentro de una breve ventana de prueba inicial. Anthropic admite que probablemente sea imposible prevenir por completo los jailbreaks universales, y su objetivo declarado es hacer que aquellos que sigan siendo lo suficientemente lentos y costosos como para detectarlos antes de que se utilicen a escala.

¿Por qué la capacidad es una amenaza?

Los argumentos a favor de tratar este modelo con cuidado se expusieron en abril, cuando Anthropic lanzó Vista previa de Claude Mythos para un grupo limitado a través de Proyecto Ala de Vidrio. El redacción técnica del equipo rojo de Anthropic es la parte que vale la pena leer.

Durante las pruebas, Mythos Preview identificó y aprovechó vulnerabilidades de día cero en todos los principales sistemas operativos y en todos los principales navegadores web cuando un usuario lo indicó. El error más antiguo que encontró fue una falla de hace 27 años en OpenBSD, un sistema operativo conocido principalmente por su seguridad. Escribió de forma autónoma un exploit de ejecución remota de código contra el servidor NFS de FreeBSD a partir de un error de hace 17 años, clasificado como CVE-2026-4747.

Anthropic describe el resultado como raíz completa para un atacante no autenticado desde cualquier lugar de Internet; La entrada de NVD es más mesurada, teniendo en cuenta que el desbordamiento de la pila en sí no requiere que el cliente se autentique, sino que encuadra la ejecución del código del kernel como accesible para un atacante capaz de enviar paquetes al servidor NFS mientras el módulo kgssapi.ko está cargado.

Según el propio Anthropic, no entrenó explícitamente estas capacidades en; surgieron como un efecto secundario de mejoras generales en el código, el razonamiento y la autonomía, las mismas ganancias que hacen que el modelo sea mejor en la aplicación de parches. La advertencia categórica del equipo rojo: las mitigaciones cuyo valor de seguridad proviene de la fricción en lugar de barreras duras se vuelven mucho más débiles frente a un modelo que avanza a través de tediosos pasos de explotación a escala.

Barreras técnicas duras como KASLR y W^X aún aumentan el costo; la advertencia es más limitada, dirigida a defensas que dependen de la paciencia del atacante o del esfuerzo manual, y el modelo ahora puede autoabastecerse.

Mythos 5 lleva adelante esas habilidades. Anthropic dice que los usuarios lo encontrarán comparable o algo más potente que Mythos Preview.

El verdadero problema del defensor

El argumento defensivo no es hipotético. En las primeras semanas del Proyecto Glasswing, Anthropic y aproximadamente 50 socios utilizaron Mythos Preview para encontrar más de diez mil vulnerabilidades de gravedad alta o crítica en software de importancia sistémica.

Solo Cloudflare encontró 2000 errores, 400 de ellos de gravedad alta o crítica. Mozilla encontró y solucionó 271 en Firefox 150, más de diez veces lo que detectó en Firefox 148 usando el antiguo Opus 4.6. Anthropic dice que la misma presión es visible más allá de Glasswing, en los proveedores que envían versiones de seguridad inusualmente grandes.

Esa inundación es el truco. Encontrar errores ahora es barato y rápido. Verificarlos, clasificarlos y parchearlos no lo es, y aún funciona en tiempo humano.

Anthropic informa que los mantenedores de código abierto, ya enterrados bajo informes de errores de baja calidad generados por IA, le han pedido que ralentice sus divulgaciones porque no pueden escribir parches lo suficientemente rápido. En Glasswing, dice que un error de gravedad alta o crítica encontrado por el modelo tarda unas dos semanas en corregirse en promedio.

El cuello de botella ha pasado del descubrimiento a la solución, y la brecha entre una divulgación pública y un parche implementado es donde viven los atacantes. Los experimentos del día N del equipo rojo agudizan el punto: partiendo de nada más que un CVE revelado y su parche, Mythos Preview creó exploits de escalada de privilegios de Linux en menos de un día cada uno, con unos pocos miles de dólares o menos en cómputo.

Ciberseguridad

Para los defensores, la lectura es la misma de siempre, solo que en un tiempo más corto: asumir que un CVE de alta gravedad puede convertirse en un exploit funcional a las pocas horas de su divulgación, no semanas. Eso significa priorizar las rutas de actualización automática para los sistemas conectados a Internet y tratar los problemas de dependencia que conllevan correcciones CVE como un trabajo urgente en lugar de un trabajo atrasado.

La MFA y el registro integral siguen siendo la base, por lo que un único parche perdido no se convierte en lo único que se interpone entre un atacante y la red. Anthropic ha abierto una Programa de verificación cibernética que permite a los profesionales de seguridad examinados utilizar sus modelos para trabajos ofensivos legítimos sin las salvaguardias cibernéticas.

Un nuevo requisito de retención de datos de 30 días

Anthropic también está cambiando la forma en que maneja los datos para los modelos de clase Mythos.

Requerirá una retención de 30 días para todo el tráfico en Fable 5, Mythos 5 y modelos futuros en este nivel de capacidad, tanto en superficies propias como de terceros. La compañía dice que no utilizará los datos para capacitación ni ningún propósito que no sea de seguridad, registrará todo acceso humano y los eliminará después de 30 días, excepto cuando una investigación de seguridad u obligación legal requiera conservarlos por más tiempo.

La razón declarada es defensiva: los datos ayudan a detectar nuevos ataques y jailbreaks que operan en muchas solicitudes. Los equipos con requisitos estrictos de manejo de datos querrán tener en cuenta esa ventana de retención antes de enrutar el tráfico confidencial a través de estos modelos.

Anthropic planea ampliar el acceso a Mythos 5 a través de un programa de acceso confiable y dice que una vez que la capacidad de cómputo se ponga al día, su objetivo es volver a incluir Fable 5 en planes de suscripción sin la prima de crédito de uso que entrará en vigor después del 22 de junio.

La pregunta más importante que plantea el lanzamiento es la que Anthropic ha estado dando vueltas desde abril: están llegando modelos con capacidades similares de otros laboratorios, y no todos se enviarán con una pared de clasificadores al frente. La ventaja defensiva que Glasswing debía comprar sólo importa si el resto de la industria la utiliza.