Microsoft dice que el nuevo modelo de IA de ciberseguridad ayuda a MDASH a alcanzar el 95,95% a la mitad del costo – CYBERDEFENSA.MX

Microsoft ha lanzado su primer modelo específico de ciberseguridad en su interior MDASHsu arnés de identificación y remediación de vulnerabilidades multimodelo.

La compañía dice que MDASH, utilizando MAI-Cyber-1-Flash y GPT-5.4, obtuvo una puntuación del 95,95% en CyberGym. También afirma que la configuración cuesta un 50% menos que su mejor combinación MDASH actual de GPT-5.4, GPT-5.4 mini y GPT-5.3 Codex. El acceso está limitado a clientes MDASH aprobados a través de una versión preliminar privada de Azure AI Foundry.

MAI-Cyber-1-Flash está diseñado para manejar hasta el 90% de las tareas MDASH, con GPT-5.4 reservado para el 10% más difícil. Está disponible solo dentro de MDASH, no como un modelo público independiente o una interfaz de programación de aplicaciones de propósito general.

La puntuación principal pertenece a MDASH que ejecuta MAI-Cyber-1-Flash junto con GPT-5.4, no al nuevo modelo en sí. CyberGym Nivel 1 es una prueba de reproducción de vulnerabilidad conocida. Le da al agente una descripción de la vulnerabilidad y el código fuente correspondiente sin parches, luego verifica si puede producir una prueba de concepto funcional. No mide el descubrimiento ciego de vulnerabilidades ni si un parche generado es correcto.

CyberGym’s tabla de clasificación pública no incluyó el resultado del 95,95% de Microsoft cuando se verificó el 28 de julio de 2026. Aún incluyó la presentación MDASH de Microsoft del 12 de mayo con un 88,4%. Los materiales públicos de Microsoft no dicen si el resultado se envió para su inclusión en la lista.

Ciberseguridad

El resultado anterior de Microsoft de 96,55% MDASH no resuelve la comparación. Esa cifra de junio contó cualquier falla, incluidas las vulnerabilidades no objetivo. Los materiales de julio no dicen si el resultado del 95,95% utiliza el mismo criterio, por lo que los dos puntajes no pueden leerse con seguridad como una tendencia de desempeño de antes y después.

Según Microsoft tarjeta modeloMAI-Cyber-1-Flash es un transformador de escasa mezcla de expertos con 137 mil millones de parámetros totales, cinco mil millones de parámetros activos y una ventana de contexto de 256 000 tokens. Es un ajuste fino de ciberseguridad de MAI-Código-1-Flashque se desarrolló a partir de un punto de control de mitad de entrenamiento de MAI-Thinking-1.

La tarjeta modelo dice que la configuración evaluada reemplazó el 80% de los modelos existentes de MDASH y elevó el resultado informado de CyberGym del 88,4% al 95,95%. Esa cifra del 80% es la proporción de modelos reemplazados. La cifra separada del 90% es la proporción máxima de tareas que Microsoft dice que puede realizar el modelo más pequeño.

En conjunto, el diseño revelado apunta al enrutamiento como la afirmación técnica central: MAI-Cyber-1-Flash está diseñado para manejar la mayoría de las tareas, GPT-5.4 se encarga del resto más difícil y Microsoft informa el resultado a nivel del sistema MDASH.

Microsoft anuncio de lanzamiento define el ahorro del 50% en comparación con su mejor combinación actual de modelos MDASH de GPT-5.4, GPT-5.4 mini y GPT-5.3 Codex. La página del producto describe por separado que el sistema ofrece «rendimiento comparable al 50% del costo de los modelos líderes». El anuncio y la tarjeta modelo no revelan el uso del token, el volumen de llamadas, la latencia, la combinación de tareas o la asignación de cómputo detrás de esa comparación, por lo que la cifra aún no se puede reproducir ni normalizar de forma independiente con respecto a otros sistemas.

«El modelo es un insumo, el sistema que lo rodea es el producto».

Ciberseguridad

Taesoo Kim, vicepresidente de seguridad agente de Microsoft, utilizó esa distinción cuando describiendo MDASH en junio. Bajo un arnés de terminal liviano, la tarjeta modelo reporta puntuaciones de 0,314 en CVEBench, 0,553 en inteligencia de amenazas CyberSecEval4, 0,33 en su prueba de análisis de malware y 0,651 en CRSBench con POV=1200.

El modelo obtuvo una puntuación de cero en las categorías de kernel, espacio de usuario y navegador de ExplotarGymque solicita a los agentes que conviertan las vulnerabilidades proporcionadas y las entradas de fallas en exploits de ejecución de código que funcionen. Esos resultados provienen de diferentes tareas y escalas de puntuación, por lo que ninguna es una puntuación CyberGym independiente para MAI-Cyber-1-Flash.

Microsoft dijo que todas las pruebas de referencia se llevaron a cabo en un entorno de red aislado sin acceso a los sistemas de producción, a la Internet pública ni a servicios externos. La tarjeta modelo también advierte que el texto y el código generados pueden ser inexactos o estar incompletos y deben revisarse antes de cualquier uso posterior.

La gestión de vulnerabilidades de software utilizando MAI-Cyber-1-Flash dentro de MDASH es el primer escenario que Microsoft ha anunciado para Project Perception, su sistema más amplio para coordinar agentes de seguridad defensiva. Percepción del proyecto está programado para entrar en versión preliminar pública el 3 de agosto, y Microsoft planea extender el modelo más allá del trabajo de vulnerabilidad de software a flujos de trabajo de seguridad adicionales.