Microsoft Afirma que MDASH Supera a Claude Mythos y GPT-5.6 Sol en Prueba de Ciberseguridad

By: rootdata|2026/07/27 19:01:04

Microsoft ha lanzado su primer modelo dedicado a la ciberseguridad llamado MAI-Cyber-1-Flash y lo ha integrado en MDASH, un sistema de búsqueda de vulnerabilidades que, según la empresa, supera a Mythos 5 de Anthropic y a GPT-5.6 Sol de OpenAI, mientras cuesta un 50% menos que la mejor configuración actual de MDASH de Microsoft.

La configuración combinada obtuvo un 95.95% en CyberGym, según Microsoft. CyberGym es un estándar que pide a los agentes de IA reproducir 1,507 vulnerabilidades conocidas en 188 proyectos de código abierto, y luego los puntúa según el porcentaje que se reprodujo con éxito en un entorno controlado.

Eso coloca a MDASH por delante de GPT-5.5 Cyber con un 85.6%, Mythos 5 con un 83.8%, GPT-5.6 Sol con un 83.6% y Gemini 3.5 Flash Cyber con un 83.2%. El resultado es autoinformado por Microsoft y no había aparecido en la tabla de clasificación pública de CyberGym en el momento de la publicación, aunque el estándar utiliza un conjunto de pruebas públicas y una métrica de éxito definida.

MAI-Cyber-1-Flash no trabaja solo. Microsoft dice que maneja hasta el 90% de las tareas, mientras que MDASH dirige el 10% más difícil a GPT-5.4. Eso es importante porque los tokens—los fragmentos de texto que una IA procesa—cuestan dinero cada vez que un modelo lee código o produce una respuesta.

Esta es la primera vez que un modelo de Microsoft diseñado para la eficiencia es capaz de superar a un modelo denso de última generación construido con capacidades generales en mente. "Cuando se combina con MDASH, (MAI-Cyber-1-Flash) ofrece un rendimiento de clase mundial al 50 por ciento del costo de los modelos líderes", escribió el CEO de Microsoft, Satya Nadella.

Un modelo (en este caso MAI-Cyber-1-Flash) es la IA que razona sobre el código. Un arnés (MDASH en este caso) es la maquinaria que lo rodea: los agentes, herramientas, verificaciones y flujos de trabajo que deciden dónde buscar, desafiar hallazgos sospechosos, eliminar duplicados y demostrar que un error puede ser desencadenado.

MDASH utiliza más de 100 agentes especializados asignados a auditar el código, debatir si un hallazgo es genuino y construir una prueba de concepto—una demostración funcional de que el defecto existe.

Microsoft dijo que los escaneos ocasionales y los parches retrasados están quedando obsoletos a medida que la IA hace que el descubrimiento de errores sea más barato. La empresa argumenta que décadas de datos de seguridad le dan una ventaja, añadiendo: "Nadie puede fabricar esta historia".

Desde el lanzamiento de Claude Mythos, los expertos en ciberseguridad han estado tratando de superar o igualar sus capacidades. Los investigadores reprodujeron la búsqueda de vulnerabilidades al estilo de Mythos con modelos públicos por menos de $30 por escaneo. Dawid Moczadło, uno de los investigadores involucrados, dijo: "el foso se está moviendo del acceso al modelo a la validación".

La parte escasa se está convirtiendo en el sistema que prueba hallazgos sin enterrar a los desarrolladores bajo falsas alarmas.

Decrypt también informó que GPT-5.5 Cyber había tomado recientemente la delantera pública en CyberGym con un puntaje del 85.6%, superando por poco a Mythos. El puntaje de Microsoft está aproximadamente 10 puntos por encima de GPT-5.5 Cyber y 7.5 puntos por encima del resultado anterior de MDASH, pero evalúa el sistema completo en lugar de MAI-Cyber-1-Flash por sí solo.

Microsoft está poniendo a MDASH en vista previa privada a través de Microsoft Security Exposure Management en el portal de Defender. Los clientes pueden escanear repositorios de Git, ver hallazgos clasificados de improbable a probado, y usar el CLI de Defender para generar propuestas de correcciones de código para revisión de desarrolladores.

La vista previa actualmente limita los repositorios a aproximadamente 256MB y permite un escaneo concurrente por inquilino. Se espera que el Proyecto Perception extienda el mismo enfoque de múltiples agentes más allá del escaneo de código hacia flujos de trabajo más amplios de monitoreo y remediación de amenazas.

Precio de --

--

Descargo de responsabilidad: Este contenido se proporciona únicamente con fines generales de desarrollo de marca e informativos y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, evento en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación para comprar, vender, tradear o negociar de cualquier otra forma con cualquier criptoactivo o para utilizar cualquier servicio. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. Es posible que los servicios de WEEX y los eventos en línea no estén disponibles en todas las regiones, así como que estén sujetos a las leyes, regulaciones y requisitos de elegibilidad vigentes. Usted es responsable de asegurarse de que su uso de los servicios de WEEX cumpla con las leyes locales y de evaluar cuidadosamente los riesgos antes de participar en cualquier actividad relacionada con las criptomonedas.

También te puede interesar

iconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y MM:bd@weex.com
Programa VIP:support@weex.com