Un manuscrit scientifique peut-il obtenir un score plus élevé simplement parce qu'il est écrit différemment, tout en racontant exactement les mêmes résultats ? C'est la question au cœur d'une étude signée par Ming Li et sept autres auteurs, publiée le 10 août 2026, qui introduit dans le débat académique un concept à la fois technique et troublant : l'influence rhétorique de l'évaluation de l'IA dans les processus de révision par les pairs automatisés. La recherche démontre que les grands modèles de langage appelés à juger des articles scientifiques peuvent être influencés par le style avec lequel un texte est présenté, même lorsque le contenu scientifique reste identique.
Résumé
L'équipe de recherche a construit une expérience conçue pour isoler une seule variable : la forme, pas la substance. Partant de 120 soumissions anonymisées présentées à l'ICLR 2026, l'une des conférences les plus pertinentes dans le domaine de l'apprentissage automatique, les auteurs ont généré un corpus contrôlé de 4 200 manuscrits complets, tous dérivés des mêmes travaux originaux mais réécrits selon des variantes rhétoriques différentes.
Deux réécrivains basés sur des grands modèles de langage ont travaillé sur six dimensions rhétoriques distinctes, les transformant dans des directions opposées pour chaque manuscrit : d'une part des versions qui mettaient en avant certains aspects persuasifs, d'autre part des versions qui les atténuaient, tout en maintenant intacts les résultats scientifiques rapportés. À ce stade, cinq examinateurs IA sont intervenus, chargés d'évaluer les manuscrits selon deux protocoles distincts, un standard et un plus rigoureux, en plus de tester des configurations de réécriture conjointe, récursive et guidée par l'examinateur lui-même.
Le résultat le plus significatif est que la sensibilité rhétorique n'est pas uniforme, mais structurée selon une véritable hiérarchie. Parmi les six dimensions testées, l'encadrement des preuves et la position sur la nouveauté du travail produisent les contrastes les plus larges entre les versions réécrites dans un sens positif et celles réécrites dans un sens négatif. L'encadrement de l'objectif de la recherche forme un deuxième niveau, plus faible mais encore perceptible, tandis que les autres dimensions rhétoriques montrent des effets mineurs ou moins stables.
Cette hiérarchie se maintient également en comparant des manuscrits de qualité perçue différente par les réviseurs humains originaux. Mais il y a un détail qui rend le phénomène encore plus délicat : le mouvement des scores dépend fortement de la note de départ attribuée par le réviseur AI. Les manuscrits qui partaient avec des scores plus bas avaient tendance à monter après la réécriture rhétorique, tandis que ceux avec des scores déjà élevés avaient tendance à descendre. Les contrastes directionnels les plus nets s'observent dans les plages de scores intermédiaires, précisément là où les décisions éditoriales sont les plus incertaines et donc les plus influençables.
Un des aspects les plus contre-intuitifs de l'étude concerne l'efficacité des méthodes de manipulation rhétorique plus sophistiquées. Des workflows plus élaborés, qui combinent réécriture conjointe, récursive ou guidée par le réviseur, ne produisent pas de manière fiable de plus grands gains par rapport à des interventions plus simples. En d'autres termes, ajouter de la complexité au processus de réécriture ne signifie pas automatiquement mieux manipuler le jugement de l'AI.
Les effets de la réécriture conjointe s'avèrent fortement dépendants du modèle utilisé comme réécrivain : changer de modèle de langage large change de manière significative le résultat. Même fournir des indications explicites au réviseur AI n'a pas montré d'avantage constant par rapport à une simple seconde lecture sans guide. La réécriture répétée, de plus, produit des rendements décroissants et fortement dépendants de la configuration spécifique utilisée. L'étude identifie cependant une division des rôles plutôt nette : le modèle réécrivain détermine surtout la séparation entre les variantes opposées, tandis que le modèle réviseur détermine l'ampleur et le signe de l'effet sur le score.
Lorsque les chercheurs ont appliqué un protocole de révision plus sévère, le score moyen d'évaluation globale a chuté de 1,36 point par rapport au protocole standard. Mais voici le chiffre qui compte le plus pour ceux qui conçoivent ces systèmes : la plus grande sévérité n'a pas réduit de manière cohérente la sensibilité rhétorique des réviseurs AI. Rendre le juge plus exigeant, en somme, ne le rend pas automatiquement plus immunisé aux choix de style du texte qu'il évalue.
Pourquoi tout cela compte-t-il ? Parce que la révision scientifique est déjà sous une pression croissante. Le volume des publications augmente à un rythme exponentiel et recruter des réviseurs humains disponibles est devenu de plus en plus difficile, au point qu'une enquête menée auprès du personnel des revues Frontiers révèle que plus de la moitié des réviseurs intègrent déjà d'une manière ou d'une autre l'intelligence artificielle dans leur processus d'évaluation. Dans ce contexte, l'idée que les systèmes automatisés peuvent être manipulés avec de simples astuces rhétoriques, sans toucher au contenu scientifique, ouvre une fissure potentiellement sérieuse dans l'intégrité du processus.
Les auteurs de l'étude ne se contentent pas de documenter le problème : ils le présentent comme une forme de reward hacking, c'est-à-dire l'exploitation de raccourcis linguistiques pour obtenir un meilleur score sans réellement améliorer la qualité du travail. La conclusion qui en découle est claire : il faut des systèmes d'évaluation automatisée capables de résister à des variations rhétoriques qui n'altèrent pas le contenu scientifique. Tant que cette robustesse ne sera pas garantie, chaque ligne ajoutée ou reformulée pourrait peser plus que les données qu'un article scientifique devrait réellement communiquer.
Des choix rhétoriques tels que le cadrage des preuves et la position sur la nouveauté influencent de manière significative les jugements des réviseurs IA, même lorsque le contenu scientifique reste identique.
Un corpus contrôlé de 4 200 manuscrits, dérivés de 120 soumissions anonymisées présentées à ICLR 2026, a été utilisé.
Non : des workflows de réécriture plus élaborés n'ont pas produit de manière fiable des gains de score supérieurs par rapport à des interventions plus simples.
Le protocole de révision rigoureux a abaissé le score moyen d'évaluation globale de 1,36 point, mais sans modifier de manière cohérente la sensibilité rhétorique des réviseurs IA.
Contenu réalisé avec l'assistance de l'intelligence artificielle et avec révision éditoriale humaine.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























