Une astuce informatique permet de dévoiler la 'pensée' des modèles d'IA de pointe, révélant des distillations cachées et des fuites de données potentielles. Des chercheurs démontrent que des versions plus petites des modèles peuvent exposer leurs raisonnements cachés.
Une nouvelle astuce informatique permet de dévoiler les raisonnements internes des modèles d'intelligence artificielle les plus avancés, exposant des secrets que les entreprises technologiques tentent de protéger. Selon un article de Wired, des recherches récentes ont révélé une vulnérabilité dans les API d'OpenAI, d'Anthropic et de Google qui facilite non seulement la distillation à grande échelle, mais peut également filtrer des mots de passe et des clés API.
La méthode, développée par des scientifiques de l'Université de Tübingen, de l'Institut Max Planck, de MATS Research et de l'entreprise Snyk, permet d'extraire les "pensées" cachées des modèles de pointe. Bien que la vulnérabilité ait déjà été corrigée, cette découverte offre des preuves --- bien que non concluantes --- que certains modèles chinois pourraient avoir été entraînés en distillant des informations de raisonnement de modèles américains.
Les modèles avancés d'IA résolvent des problèmes difficiles en les décomposant en parties qu'ils analysent dans une "chaîne de pensée" artificielle. Les entreprises gardent ce raisonnement secret, mais envoient une version chiffrée à l'ordinateur de l'utilisateur pour transférer une partie du calcul.
L'attaque des chercheurs repose sur le fait que la plupart des entreprises proposent des modèles de tailles différentes. Les modèles plus petits sont plus faibles mais aussi moins alignés, ce qui signifie qu'ils sont plus enclins à révéler leurs pensées internes.
Alimenter les traces de raisonnement chiffrées à une version plus petite du même modèle peut révéler le raisonnement caché, explique Alexander Panfilov, informaticien à l'Université de Tübingen. "Tous les principaux fournisseurs de modèles de pointe que nous avons testés partagent cette vulnérabilité", avertit-il.
Panfilov et ses collègues ont testé les modèles d'OpenAI, d'Anthropic et de Google via leurs API et ont trouvé le même problème. Ils ont également démontré que la méthode pouvait extraire des informations secrètes, telles que des clés API et des mots de passe intégrés dans les traces de raisonnement.
"L'idée d'échanger des messages à une variante de modèle plus faible qui a la même clé de déchiffrement mais un alignement plus faible est géniale", commente Florian Tramer, scientifique en sécurité informatique à l'ETH de Zurich. "Cela devient définitivement un problème", ajoute-t-il.
La distillation est une technique bien établie pour copier efficacement les capacités des modèles existants vers de nouveaux. Elle est particulièrement courante dans le développement de modèles à poids ouverts ou entièrement téléchargeables.
Dernièrement, la distillation est devenue un sujet controversé en raison des allégations selon lesquelles des entreprises chinoises d'IA l'utilisent pour copier les meilleurs modèles américains. En février, OpenAI a dit aux législateurs américains que DeepSeek semblait avoir copié l'un de ses modèles pour construire le R1.
En juin, Anthropic a dit aux législateurs qu'Alibaba avait systématiquement distillé ses modèles pour construire le sien, appelé Qwen. Il n'y a aucune indication qu'ils aient utilisé cette technique spécifique, mais les chercheurs pensent que leur méthode permettrait de distiller plus d'informations de modèles fermés que ce qui était cru.
Mark Zuckerberg, directeur exécutif de Meta, a déclaré que la distillation est un principe important du fonctionnement de l'écosystème du code ouvert. Il a averti que restreindre cette pratique mettrait les États-Unis en désavantage.
D'autre part, Kyle Miller, chercheur au Center for Security and Emerging Technologies, dit qu'il n'est pas clair dans quelle mesure la distillation aide réellement la Chine. "Si la capacité des laboratoires chinois à distiller était éliminée, le paysage concurrentiel ne changerait pas de manière drastique", affirme-t-il.
Les chercheurs ont alimenté chaque modèle avec 90 questions pour vérifier si les modèles à poids ouverts distillaient des modèles fermés. En donnant les premiers mots des traces de raisonnement capturées, ils ont parfois constaté que les modèles ouverts généraient des réponses remarquablement similaires.
Le modèle chinois à poids ouverts Kimi K3, de Moonshot AI, a produit une sortie étonnamment similaire aux traces de raisonnement cachées de Claude Opus 4.8 et GPT 5.6 Sol pour certains prompts. Malgré les similitudes, les chercheurs soulignent que le travail ne peut pas établir de manière causale la distillation.
Deux autres modèles à poids ouverts, DeepSeek de Chine et Inkling de l'entreprise américaine Thinking Machines, n'ont pas montré cette similitude. Moonshot AI et Z.ai n'ont pas répondu aux demandes de commentaires.
Il y avait des spéculations antérieures sur les réseaux sociaux chinois concernant la possibilité de découvrir et d'utiliser des traces de raisonnement cachées pour la distillation. Yarin Gal, scientifique en informatique à l'Université d'Oxford, dit que la distillation est non seulement répandue, mais qu'elle a également aidé l'IA à progresser plus rapidement.
Les entreprises ont déjà pris des mesures : Panfilov et ses co-auteurs ont alerté OpenAI, Anthropic et Google, et chacune a ajusté son API pour atténuer le problème. Michael Aciman, porte-parole d'Anthropic, a déclaré qu'ils valorisent la recherche indépendante et ont commencé à développer des atténuations à court terme.
Google et OpenAI ont décliné de faire des commentaires. Panfilov ajoute que corriger complètement la distillation nécessiterait une révision fondamentale de la façon dont fonctionnent les API.
La distillation est devenue une question d'importance géopolitique alors que les États-Unis et la Chine rivalisent pour la suprématie en IA. Les faucons de la ligne dure avec la Chine affirment que le pays obtient un avantage stratégique en distillant la technologie américaine.
D'autres soutiennent que la distillation est une méthode largement utilisée pour améliorer rapidement les capacités d'un modèle d'IA. Zuckerberg défend cette pratique du point de vue du code ouvert.
Kyle Miller souligne que cela n'améliore les capacités des modèles existants que dans une mesure limitée et que les entreprises chinoises semblent avoir l'expertise nécessaire pour construire des modèles de pointe à partir de zéro. "Personne ici aux États-Unis ne sait à quel point la distillation bénéficie aux laboratoires chinois", dit-il.
Les chercheurs soulignent également que la méthode pourrait être utilisée pour récupérer des informations personnelles, bien que cette vulnérabilité ait déjà été corrigée. Cependant, certaines traces de raisonnement peuvent encore être découvertes avec la même méthode.
Panfilov et ses collaborateurs affirment que l'utilisation de leur méthode permettrait de distiller plus d'informations des modèles fermés que ce qui était cru jusqu'à présent. Cela pourrait avoir des implications significatives pour la propriété intellectuelle dans l'industrie de l'IA.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























