Paul Miller, développeur maintenant des bibliothèques de cryptographie utilisées dans des projets Bitcoin et Ethereum, a testé 7 agents d'intelligence artificielle (IA) pour classer et corriger 5 vulnérabilités de sécurité réelles, signalées par le groupe Bitcoin Red Team. Le résultat a montré des différences marquées entre les modèles, tant en termes de dépenses en dollars pour les exécuter que de précision de leurs diagnostics.
Parmi les 7 agents évalués, 3 n'ont pas réussi à terminer la tâche. Qwen 3.8, d'Alibaba, s'est bloqué pendant le processus, sans raison déclarée par Miller. GPT-5.6 Sol, d'OpenAI, et Fable, d'Anthropic, ont directement refusé de travailler sur le code, selon Miller lui-même, bien que la tâche consistait à identifier et réparer des erreurs, et non à les exploiter.
Les 4 agents qui ont terminé le travail, Grok 4.6 (xAI), Kimi K3 (Moonshot AI), DeepSeek V4 Pro et DeepSeek V4 Flash (DeepSeek), ont eu des dépenses en dollars très disparates pour la consommation de tokens (instructions des utilisateurs) lors de leur exécution :
Le temps nécessaire a également varié considérablement. DeepSeek V4 Pro a terminé son travail en 30 minutes, Kimi K3 en 40 minutes et Grok 4.6 en 1 heure, tandis que DeepSeek V4 Flash a nécessité 3 heures, six fois (500 %) plus que DeepSeek V4 Pro pour la même tâche.
Selon Miller, seul Grok 4.6 a coïncidé avec sa propre évaluation de la gravité des 5 vulnérabilités.
Les 3 autres agents qui ont terminé le travail (Kimi K3, DeepSeek V4 Pro et DeepSeek V4 Flash) ont exagéré la gravité des erreurs trouvées, ce qui, selon Miller lui-même, a affecté la qualité générale des résultats fournis par ces 3 modèles.
Le test de Miller se déroule au milieu d'une vague d'attaques utilisant l'intelligence artificielle pour accélérer la recherche et l'exploitation des vulnérabilités de sécurité dans l'écosystème bitcoin.
Au cours des dernières semaines, Coldcard, Boltz, ZEUS, BTCPay Server et LNP2Pbot ont subi des incidents de sécurité liés à des erreurs que des attaquants ont identifiées et exploitées avec l'aide de modèles d'IA. Aucun de ces cas n'a affecté le protocole Bitcoin lui-même, mais des produits et services opérant en dehors du réseau.
Cette vague d'incidents a poussé le Bitcoin Red Team, un groupe de développeurs dédié à la recherche de vulnérabilités de sécurité dans des projets open source de Bitcoin, à lancer un audit massif assisté par IA sur l'écosystème.
L'audit du Bitcoin Red Team a déjà couvert plus de 300 dépôts de code open source, et de ce travail sont issues les 5 vulnérabilités que Miller a utilisées comme base pour son propre test sur les 7 agents d'IA, parmi autres 8 000 erreurs trouvées par ce groupe de chercheurs, comme l'a rapporté CriptoNoticias.
Parmi les 7 agents que Miller a testés, 4 sont open source, Kimi K3, DeepSeek V4 Pro, DeepSeek V4 Flash et Qwen 3.8. Cela signifie que les entreprises qui les ont formés ont publié leurs paramètres de manière publique, permettant à tout utilisateur de les télécharger et de les exécuter sur ses propres machines, sans dépendre de l'approbation de ces entreprises.
Les 3 autres agents, Grok 4.6, GPT-5.6 Sol et Fable, sont fermés, donc ils ne peuvent être utilisés que via la plateforme ou l'interface de programmation d'applications (API) de l'entreprise qui les a développés.
Cette distinction entre modèles open source et fermés est pertinente pour la sécurité de l'écosystème bitcoin. En s'exécutant sur les serveurs de chaque entreprise, les modèles fermés permettent à leurs créateurs de maintenir des filtres de sécurité actifs, comme ceux qui ont conduit GPT-5.6 Sol et Fable à refuser de travailler sur les vulnérabilités dans ce test.
Les modèles open source, en revanche, peuvent être exécutés sur un ordinateur local et être modifiés par tout utilisateur, ce qui rend possible la suppression de ces filtres de sécurité. Un attaquant pourrait utiliser une version sans restrictions de l'un de ces mêmes modèles pour assister à de réelles attaques contre des plateformes de l'écosystème bitcoin, quelque chose qu'aucun filtre externe ne pourrait empêcher.
Le test de Miller expose que, au-delà des avancées de l'intelligence artificielle dans la détection des vulnérabilités, des différences significatives persistent entre les différents modèles en matière de classification et de correction avec précision, tant en termes de dépenses en dollars que de critères appliqués.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























