Microsoft afirma que MDASH supera Claude Mythos e GPT-5.6 Sol em teste de cibersegurança

By: rootdata|2026/07/27 19:01:04
0
Compartilhar
copy
Avalie no GoogleAvalie no Google

A Microsoft lançou seu primeiro modelo dedicado à cibersegurança chamado MAI-Cyber-1-Flash e o integrou ao MDASH, um sistema de busca de vulnerabilidades que, segundo a empresa, supera o Mythos 5 da Anthropic e o GPT-5.6 Sol da OpenAI, custando 50% menos do que a configuração atual do MDASH, que é a melhor da Microsoft.

A configuração combinada obteve uma pontuação de 95,95% no CyberGym, de acordo com a Microsoft. O CyberGym é um benchmark que pede a agentes de IA que reproduzam 1.507 vulnerabilidades conhecidas em 188 projetos de código aberto, e depois os pontua pela porcentagem de reproduções bem-sucedidas em um ambiente controlado.

Isso colocou o MDASH à frente do GPT-5.5 Cyber, que obteve 85,6%, do Mythos 5 com 83,8%, do GPT-5.6 Sol com 83,6% e do Gemini 3.5 Flash Cyber com 83,2%. O resultado é auto-relatado pela Microsoft e não havia aparecido na tabela de classificação pública do CyberGym no momento da publicação, embora o benchmark utilize um conjunto de testes público e uma métrica de sucesso definida.

O MAI-Cyber-1-Flash não funciona sozinho. A Microsoft afirma que ele lida com até 90% das tarefas, enquanto o MDASH direciona os 10% mais difíceis para o GPT-5.4. Isso é importante porque os tokens—os pedaços de texto que uma IA processa—custam dinheiro toda vez que um modelo lê código ou produz uma resposta.

Esta é a primeira vez que um modelo da Microsoft, projetado para eficiência, é capaz de superar um modelo denso de última geração construído com capacidades gerais em mente. "Quando combinado com o MDASH, (MAI-Cyber-1-Flash) oferece desempenho de classe mundial a 50% do custo dos modelos líderes", escreveu o CEO da Microsoft, Satya Nadella.

Um modelo (neste caso, MAI-Cyber-1-Flash) é a IA que raciocina sobre o código. Um suporte (MDASH, neste caso) é a maquinaria ao seu redor: os agentes, ferramentas, verificações e fluxo de trabalho que decidem onde olhar, desafiar descobertas suspeitas, remover duplicatas e provar que um bug pode ser acionado.

O MDASH utiliza mais de 100 agentes especializados designados para auditar código, debater se uma descoberta é genuína e construir uma prova de conceito—uma demonstração funcional de que a falha existe.

A Microsoft afirmou que escaneamentos ocasionais e patches atrasados estão se tornando obsoletos à medida que a IA torna a descoberta de bugs mais barata. A empresa argumenta que décadas de dados de segurança lhe dão uma vantagem, acrescentando: "Ninguém pode fabricar essa história."

Desde o lançamento do Claude Mythos, especialistas em cibersegurança têm tentado superar ou igualar suas capacidades. Pesquisadores reproduziram a caça de vulnerabilidades no estilo Mythos com modelos públicos por menos de $30 por escaneamento. Dawid Moczadło, um dos pesquisadores envolvidos, disse: "o fosso está se movendo do acesso ao modelo para a validação."

A parte escassa está se tornando o sistema que prova descobertas sem sobrecarregar os desenvolvedores com alarmes falsos.

O Decrypt também relatou que o GPT-5.5 Cyber havia recentemente assumido a liderança pública no CyberGym com uma pontuação de 85,6%, superando o Mythos por pouco. A pontuação da Microsoft está cerca de 10 pontos acima do GPT-5.5 Cyber e 7,5 pontos acima do resultado anterior do MDASH, mas avalia o sistema completo em vez do MAI-Cyber-1-Flash isoladamente.

A Microsoft está colocando o MDASH em pré-visualização privada por meio do Microsoft Security Exposure Management no portal do Defender. Os clientes podem escanear repositórios Git, ver descobertas classificadas de improváveis a comprovadas e usar o Defender CLI para gerar correções de código propostas para revisão dos desenvolvedores.

A pré-visualização atualmente limita os repositórios a aproximadamente 256MB e permite um escaneamento simultâneo por inquilino. O Projeto Perception deve estender a mesma abordagem de múltiplos agentes além da varredura de código para monitoramento de ameaças mais amplo e fluxos de trabalho de remediação.

Preço de --

--

Aviso: Este conteúdo é fornecido apenas para fins de divulgação e informação geral da marca e não constitui aconselhamento financeiro, de investimento, jurídico ou tributário. Quaisquer eventos, recompensas, eventos online ou informações relacionadas mencionados neste documento não devem ser considerados uma recomendação, solicitação ou convite para comprar, vender, negociar ou de qualquer outra forma realizar transações com criptoativos ou usar quaisquer serviços. Criptoativos são altamente voláteis, e sua negociação pode resultar em perdas. Os serviços e eventos online da WEEX podem não estar disponíveis em todas as regiões e estão sujeitos às leis, regulamentos e requisitos de elegibilidade aplicáveis. É sua responsabilidade garantir que o uso dos serviços da WEEX esteja em conformidade com as leis locais e avaliar cuidadosamente os riscos antes de participar de quaisquer atividades relacionadas a criptomoedas.

Você também pode gostar

iconiconiconiconiconiconicon
Atendimento ao cliente:@weikecs
Parcerias comerciais:@weikecs
Quant trading e MM:bd@weex.com
Programa VIP:support@weex.com