Selon la société de sécurité Frontier Security, le Kimi K3 de Moonshot AI a quitté le bac à sable dans lequel il était testé et est allé sur Internet pour trouver des réponses aux problèmes qui lui avaient été posés.
Le modèle était évalué sur ses compétences en cybersécurité défensive et avait été expressément chargé de résoudre des problèmes sans chercher de réponses. Il n'a pas du tout tenté la tâche, a déclaré Frontier. Au lieu de cela, il a sondé le réseau, a établi que la résolution DNS pour github.com fonctionnait, a cloné le dépôt de référence officiel et a lu la solution sur le disque.
Frontier appelle cela "le jeu de spécifications via des fuites de sortie réseau", notant que les bacs à sable construits sur des frameworks tels que l'Institut de sécurité de l'IA Inspect bloquent le trafic entrant tout en laissant ouverts les ports HTTPS et DNS sortants. Les agents capables inspectent leur propre environnement shell au démarrage par routine, et un modèle qui trouve github.com accessible peut tirer des solutions de référence avec des outils de ligne de commande standard.
Une mauvaise configuration a rendu cela possible, comme cela a été le cas dans des incidents récents divulgués par OpenAI et Anthropic. "Nous avons trouvé une fuite dans le bac à sable," a déclaré le PDG Yaron Singer à WIRED. "Mais nous avons également découvert que Kimi a profité de cette faille."
Le chercheur Paul Kassianik a déclaré à WIRED que le modèle est "très bon pour atteindre un objectif par tous les moyens nécessaires" et manque des garde-fous qui l'empêcheraient de tricher ou de s'échapper. Moonshot n'a pas répondu à la demande de commentaire de la publication.
Alors que les modèles d'Anthropic et d'OpenAI qui ont brisé les contenants ont été pris lors d'évaluations internes, l'un d'eux non publié, et les versions qui ont ciblé de vraies personnes lors des tests du gouvernement britannique avaient leurs classificateurs cybernétiques délibérément désactivés, le Kimi K3 est téléchargeable librement, et Frontier l'a testé avec les protections qu'un utilisateur ordinaire obtiendrait. Cette disponibilité, a écrit la société, met le même comportement à la portée d'acteurs adverses et rend l'incident potentiellement plus nuisible.
Kimi K3 n'a également causé aucun dommage. Il n'a attaqué rien une fois dehors, car il n'en avait pas besoin. Le modèle d'OpenAI a piraté Hugging Face et quatre autres services pour atteindre des réponses de référence, tandis que Kimi a trouvé ses réponses dans un dépôt public.
Le bac à sable utilisé par Frontier était construit sur le cadre d'évaluation de l'Institut de sécurité de l'IA du Royaume-Uni. L'AISI a révélé cette semaine que des agents dans ses propres tests cybernétiques étaient allés sur Internet en direct et avaient ciblé de vraies personnes---un incident séparé, impliquant des modèles d'Anthropic et d'OpenAI avec leurs protections désactivées. Son rapport publié mardi note que l'AISI scanne désormais les évaluations historiques pour un comportement similaire, et que Kimi K3 est parmi les modèles sous examen. L'AISI n'a pas répondu à la demande de commentaire de WIRED.
La plus grande affirmation de Frontier est que les benchmarks eux-mêmes sont compromis. Un modèle qui lit la réponse sur GitHub passe toujours, donc des scores élevés peuvent refléter un environnement fuyant plutôt qu'un raisonnement authentique. Et si un modèle capable a trouvé le raccourci, soutient la société, d'autres ayant accès au shell pourraient également le prendre, ce qui gonflerait les résultats dans le domaine plutôt que pour Kimi seul.
Les modèles s'optimisent pour la fonction objective, a écrit Frontier, pas pour "l'intention humaine derrière le benchmark", ajoutant que là où un chemin réseau vers la solution existe, "un agent suffisamment capable le trouvera."
Matt Fredrikson, PDG de Gray Swan et professeur associé à Carnegie Mellon, a déclaré à WIRED que le comportement n'est pas remarquable. Donnez à un modèle un objectif sans murs explicites autour, a-t-il dit, et "il trouvera un moyen d'obtenir la réponse." Il a décrit cela comme une histoire d'avertissement pour quiconque utilise des modèles comme agents dans des outils tels qu'OpenClaw.
Les chercheurs de Frontier font le même constat dans l'autre sens : la capacité qui permet à Kimi de trouver son chemin sort fait également des modèles à poids ouverts de puissants outils défensifs. Leurs propres benchmarks évaluent Kimi hautement pour trouver des vulnérabilités dans les logiciels et les réseaux, et Hugging Face a utilisé un modèle chinois non nommé pour se défendre lors de l'incident OpenAI.
Publié en juillet, Kimi K3 est le plus grand modèle open-source jamais publié et a secoué les marchés lors des comparaisons avec le lancement de DeepSeek.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























