Microsoft afirma que MDASH supera a Claude Mythos y GPT-5.6 Sol en prueba de ciberseguridad

By: rootdata|2026/07/27 19:01:04

Microsoft ha lanzado su primer modelo de ciberseguridad dedicado llamado MAI-Cyber-1-Flash y lo ha integrado en MDASH, un sistema de búsqueda de vulnerabilidades que, según la compañía, supera a Mythos 5 de Anthropic y a GPT-5.6 Sol de OpenAI, mientras cuesta un 50% menos que la mejor configuración actual de MDASH de Microsoft.

La configuración combinada obtuvo un 95.95% en CyberGym, según Microsoft. CyberGym es un estándar que pide a los agentes de IA reproducir 1,507 vulnerabilidades conocidas en 188 proyectos de código abierto, y luego los puntúa según el porcentaje que se reproduce con éxito en un entorno controlado.

Eso coloca a MDASH por delante de GPT-5.5 Cyber con un 85.6%, Mythos 5 con un 83.8%, GPT-5.6 Sol con un 83.6% y Gemini 3.5 Flash Cyber con un 83.2%. El resultado es autoinformado por Microsoft y no había aparecido en la tabla de clasificación pública de CyberGym en el momento de la publicación, aunque el estándar utiliza un conjunto de pruebas público y una métrica de éxito definida.

MAI-Cyber-1-Flash no trabaja solo. Microsoft afirma que maneja hasta el 90% de las tareas, mientras que MDASH dirige el 10% más difícil a GPT-5.4. Esto es importante porque los tokens—los fragmentos de texto que procesa una IA—cuestan dinero cada vez que un modelo lee código o produce una respuesta.

Esta es la primera vez que un modelo de Microsoft diseñado para la eficiencia es capaz de superar a un modelo denso de última generación construido con capacidades generales en mente. "Cuando se combina con MDASH, (MAI-Cyber-1-Flash) ofrece un rendimiento de clase mundial al 50 por ciento del costo de los modelos líderes", escribió el CEO de Microsoft, Satya Nadella.

Un modelo (en este caso MAI-Cyber-1-Flash) es la IA que razona sobre el código. Un arnés (MDASH en este caso) es la maquinaria que lo rodea: los agentes, herramientas, verificaciones y flujos de trabajo que deciden dónde buscar, desafiar hallazgos sospechosos, eliminar duplicados y probar que se puede activar un error.

MDASH utiliza más de 100 agentes especializados asignados a auditar código, debatir si un hallazgo es genuino y construir una prueba de concepto—una demostración funcional de que la falla existe.

Microsoft dijo que los escaneos ocasionales y los parches retrasados están quedando obsoletos a medida que la IA hace que el descubrimiento de errores sea más barato. La compañía argumenta que décadas de datos de seguridad le dan una ventaja, añadiendo: "Nadie puede fabricar esta historia".

Desde el lanzamiento de Claude Mythos, los expertos en ciberseguridad han estado tratando de superar o igualar sus capacidades. Los investigadores reprodujeron la búsqueda de vulnerabilidades al estilo de Mythos con modelos públicos por menos de $30 por escaneo. Dawid Moczadło, uno de los investigadores involucrados, dijo: "la trinchera se está moviendo del acceso al modelo a la validación".

La parte escasa se está convirtiendo en el sistema que prueba hallazgos sin enterrar a los desarrolladores bajo falsas alarmas.

Decrypt también informó que GPT-5.5 Cyber había tomado recientemente la delantera pública de CyberGym con un puntaje del 85.6%, superando por poco a Mythos. El puntaje de Microsoft es aproximadamente 10 puntos superior al de GPT-5.5 Cyber y 7.5 puntos por encima del resultado anterior de MDASH, pero evalúa el sistema completo en lugar de MAI-Cyber-1-Flash por sí solo.

Microsoft está poniendo MDASH en vista previa privada a través de Microsoft Security Exposure Management en el portal de Defender. Los clientes pueden escanear repositorios de Git, ver hallazgos clasificados de improbable a probado, y usar el CLI de Defender para generar propuestas de correcciones de código para revisión de desarrolladores.

La vista previa actualmente limita los repositorios a aproximadamente 256 MB y permite un escaneo concurrente por inquilino. Se espera que Project Perception extienda el mismo enfoque de múltiples agentes más allá del escaneo de código hacia flujos de trabajo de monitoreo y remediación de amenazas más amplios.

Precio de --

--

Descargo de responsabilidad: Este contenido se proporciona únicamente con fines generales de desarrollo de marca e informativos y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, evento en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación para comprar, vender, tradear o negociar de cualquier otra forma con cualquier criptoactivo o para utilizar cualquier servicio. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. Es posible que los servicios de WEEX y los eventos en línea no estén disponibles en todas las regiones, así como que estén sujetos a las leyes, regulaciones y requisitos de elegibilidad vigentes. Usted es responsable de asegurarse de que su uso de los servicios de WEEX cumpla con las leyes locales y de evaluar cuidadosamente los riesgos antes de participar en cualquier actividad relacionada con las criptomonedas.

También te puede interesar

iconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y MM:bd@weex.com
Programa VIP:support@weex.com