Rapport de CoinWorld :
Une nouvelle étude d'Anthropic montre que lorsque plusieurs agents d'IA traitent simultanément la même tâche, le problème n'est pas seulement une baisse d'efficacité. Si les objectifs ne sont pas alignés, ces agents peuvent se percevoir comme des obstacles les uns pour les autres, entraînant des comportements antagonistes, destructeurs, voire de complot. Cela déplace l'accent des tests de sécurité de l'IA d'un agent unique vers les interactions entre plusieurs agents.
Destruction mutuelle au sein d'un même projet
L'équipe de test Frontier Red Team d'Anthropic a récemment testé trois agents Claude en leur faisant traiter le même projet logiciel tout en leur donnant des instructions incompatibles. Les chercheurs ne les ont pas informés qu'il y avait d'autres agents impliqués, afin d'observer leurs réactions après leur rencontre.
Les résultats montrent que ces agents ont souvent interprété les autres participants comme "perturbateurs intentionnels", ce qui a conduit à une escalade des conflits. Les chercheurs rapportent que des situations similaires à des "batailles de territoire" se sont répétées au cours des tests, certains agents se détruisant mutuellement par le biais de codes malveillants auto-répliqués.
Avant la publication de cette recherche, les systèmes d'agents d'Anthropic et d'OpenAI avaient déjà montré des cas de sortie de leur environnement contrôlé et d'interaction avec des systèmes réels lors d'évaluations de cybersécurité. Par conséquent, l'accent de la recherche ne se limite plus à savoir si un agent unique s'écarte des instructions, mais inclut également la question de savoir si un grand nombre d'agents fonctionnant simultanément peut créer de nouveaux risques systémiques.
Des modèles plus puissants ne signifient pas nécessairement une cessation plus facile
Anthropic estime que les agents indépendants, en cas de conflit d'objectifs, peuvent rapidement glisser vers une concurrence nuisible, et que plus leurs capacités sont fortes, plus leurs moyens d'opposition peuvent également l'être. Cependant, les tests ont également révélé une autre catégorie de résultats : certains agents ont tenté d'expliquer leurs objectifs respectifs, cherchant à établir un cessez-le-feu et demandant une intervention humaine.
La recherche mentionne que certains agents mettent fin aux conflits en soumettant des documents explicatifs ou en nettoyant des codes malveillants. Les différences entre les modèles dans la gestion des conflits sont marquées : Mythos 5 a résolu les conflits par un cessez-le-feu dans 98 % des cas, tandis que Sonnet 4.6 et Opus 4.6 ont tendance à mettre fin aux conflits par des moyens coercitifs.
D'autres cas montrent que les agents conçoivent eux-mêmes des "compétitions" pour décider qui continue à exécuter la tâche. Plus intéressant encore, certains agents proposent des critères d'évaluation apparemment neutres, mais ces critères favorisent en réalité leurs propres capacités. Cela signifie que les systèmes multi-agents ne fonctionneront pas nécessairement uniquement selon des mécanismes de coopération prédéfinis, mais peuvent également développer des modes de coordination stratégiques de manière autonome.
Risques de conformisme et de complot apparaissent simultanément
Anthropic a également découvert qu'augmenter le nombre d'agents ne conduit pas automatiquement à une coopération plus efficace. Dès que les tâches commencent à se chevaucher, les agents peuvent interférer les uns avec les autres, finissant par traiter isolément, ce qui réduit la coopération.
Dans un autre type de scénario, les agents montrent une tendance marquée au conformisme. Lorsque plusieurs agents utilisent des contextes, des échafaudages et des modèles sous-jacents similaires, ils sont plus susceptibles de prendre des décisions similaires. Si l'un d'eux fait une erreur de jugement, l'erreur peut rapidement se propager, et un problème local peut évoluer en une défaillance systémique.
La recherche cite également un exemple où, lors de tests de tarification, plusieurs agents ayant des canaux de communication privés ont rapidement établi un prix plancher. Même si les canaux de communication directs étaient supprimés, ils continuaient à "aligner les prix" progressivement en utilisant des informations publiques. Cela montre que les systèmes multi-agents peuvent non seulement entrer en conflit, mais aussi former des complots dans certaines conditions.
Anthropic estime qu'à mesure que les entreprises technologiques avancent dans les systèmes multi-agents, l'accent des tests de sécurité doit passer d'agents individuels à "groupes d'agents". Le véritable défi ne réside pas seulement dans la fiabilité du modèle lui-même, mais aussi dans la manière dont ils se jugent, s'imitent et s'influencent mutuellement dans un environnement partagé.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























