L'agent de sécurité AI de GCSA enregistre 91,3 % dans CyberGym
L'agent de sécurité AI de GCSA a enregistré un taux de réussite de 91,3 % lors de l'évaluation de CyberGym. Cet agent est basé sur les modèles 4.5 et 4.6 de Grok, et CyberGym est un système d'évaluation des agents de sécurité AI qui inclut 1 507 cas de vulnérabilités réelles provenant de 188 projets logiciels. L'évaluation se concentre sur la capacité à reproduire des vulnérabilités réelles plutôt que sur la compréhension du code, et le succès de l'agent AI est déterminé par sa capacité à expliquer les vulnérabilités, analyser le code et inférer les chemins d'attaque. GCSA décrit ce résultat comme une performance des agents de sécurité AI et a également présenté des exemples où l'AI a découvert des vulnérabilités de type zero-day et des correctifs de sécurité incomplets. Cependant, les résultats du tableau de classement de CyberGym peuvent varier en fonction des soumissions des équipes, et la différence de score ne reflète pas nécessairement une différence de capacité réelle. Le résultat de 91,3 % de l'agent GCSA indique une performance élevée, mais l'impact de ce score sur la qualité de la sécurité des services nécessite une validation supplémentaire.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

The Block lance officiellement The Raytant, un média spécialisé en IA

Jev explose soudainement : ne sait pas discuter, ne code pas, se contente de juger

Le directeur mondial de la macroéconomie chez Fidelity affirme que le marché haussier du Bitcoin sur un cycle de quatre ans pourrait avoir commencé

La loi CLARITY nécessite 3 sénateurs supplémentaires et une course contre la montre pour un renouveau en 2026

Shanghai promeut l'amélioration de la qualité et de l'efficacité des finances technologiques, en appliquant des technologies telles que la blockchain et l'informatique quantique

DeepSeek V4.1 Flash obtient 81,2, coût de 1,4 % pour GPT-6 Astra

Google DeepMind lance la base de données génétique AI AlphaGenome Atlas

Apple lance une nouvelle application de santé "Readiness"

Probabilité de victoire de BLG contre AL en playoffs LPL est de 77%

KakaoBank réorganise l'écran d'accueil de son application avec l'ajout de cartes et d'informations sur les investissements

Seulement 12 % des actifs tokenisés répondent aux critères DeFi

AIP2-1.0 en tête des tests, le coût de Claude est près de 9 fois plus élevé

L'équipe Baidu Wenxin recrute des chercheurs nord-américains et l'auteur principal de DeepSeek

La nouvelle version de Grok 4.7 sera publiée dans les 10 prochains jours

CoinGecko déplace son score de sécurité vers CORE3, près de la moitié des échanges sans preuve de sécurité

L'indice de sentiment Bitcoin tombe à 70, restant dans la zone d'extrême avidité

Le PDG de Coinbase : La réputation sur la chaîne remplacera le score de crédit FICO

Better Mortgage et Coinbase proposent des prêts hypothécaires garantis par Bitcoin allant jusqu'à 250 000 dollars

La part des altcoins atteint 65 %, une tendance opposée à celle du marché des futures

Standard ERC-8196 finalisé, supporte l'exécution des stratégies de portefeuille AI Agent

L'indice de peur et de cupidité à 72, maintient la zone de cupidité

TermiX lance une infrastructure de paiement AI Agent avec un volume de transactions d'environ 220K

Lancement des puces Xuanjie O3, O100 et D100 par Lei Jun

Microsoft corrige la vulnérabilité CVE-2026-69836 dans Entra ID

DeepSeek V4 Flash, réduit l'écart de performance avec Claude

Le modèle de vision DeepSeek enregistre un score de 2 victoires et 2 défaites contre l'Opus 4.8

Talent Protocol acquis par IPTS, Builder Score devient un produit public

Ajout d'un ordinateur quantique IonQ à KoreaQuantum de Korea Advanced Materials

Lyon maintient la note « surperformer » pour Zhizhu GLM-5.3, avec un objectif de prix de 2061 HKD





