OpenAI annonce des progrès internes sur le RSI : un "stagiaire de recherche automatisé" réalisé
Auteur : Long Yue
Le flywheel de l'IA commence à tourner : OpenAI a révélé des données internes, montrant que la charge de travail des agents intelligents est désormais plus de trois fois supérieure à celle des chercheurs humains.
Le 6 septembre, le blog officiel d'OpenAI a publié un article intitulé "Accélération de la recherche : un aperçu interne d'OpenAI" (Research acceleration: The view inside OpenAI), dévoilant pour la première fois les progrès du "RSI" (amélioration récursive de l'IA) sous forme de données internes. OpenAI a déclaré avoir atteint l'objectif fixé à l'automne dernier : créer un "stagiaire de recherche automatisé" d'ici septembre de cette année.
La définition d'OpenAI pour un "stagiaire de recherche" est : "un système capable d'exécuter des tâches de recherche clairement définies sous la direction humaine, y compris celles qui nécessitent plusieurs jours de travail d'un chercheur expérimenté."
L'objectif suivant est d'atteindre un "chercheur IA automatisé" complet d'ici mars 2028, capable de participer à des recherches sur l'apprentissage profond et l'alignement, et d'améliorer le système par itération.
Cela signifie que le flywheel de "l'IA formant l'IA" s'accélère : l'IA produit plus de code et de résultats d'expérimentation, le progrès de la recherche s'accélère, de meilleurs modèles sont formés, ce qui améliore à son tour les capacités des agents intelligents.
Le flywheel tourne : la charge de travail des agents IA est trois fois supérieure à celle des humains
D'après les données publiées par OpenAI, les agents intelligents ont d'abord changé la manière dont les chercheurs travaillent au quotidien.
Au début de cette année, un chercheur d'OpenAI, classé au milieu en termes d'utilisation des agents, utilisait encore relativement peu les agents de codage. D'ici la mi-août, ces chercheurs avaient intégré les agents dans leur flux de travail quotidien. En termes de coût API, l'utilisation quotidienne des agents par un chercheur médian a dépassé 600 USD ; les chercheurs dans le top 10 % de l'organisation ont utilisé des tokens d'une valeur de plus de 7000 USD par jour.
OpenAI a également noté que l'utilisation des agents dans le département de recherche croît plus rapidement que dans les autres équipes de l'entreprise. En calculant l'évolution des tokens des employés médians, l'utilisation dans le département de recherche a augmenté de 124 fois depuis décembre 2025.
Un tournant clé s'est produit en juin de cette année.
Avant juin, le temps total d'exécution des agents dans l'organisation de recherche était encore inférieur au temps de travail total des humains. Après cela, la situation s'est inversée. À la mi-août, en tenant compte d'une journée de travail standard de 8 heures, pour chaque jour de travail humain consommé, les agents de recherche avaient produit 3,1 jours de travail.
Parallèlement, OpenAI a déclaré que de plus en plus de chercheurs exécutaient simultanément quatre sessions d'agents ou plus.
Accélération du code et des expériences, les étapes exécutables du processus de R&D amplifiées
OpenAI décrit le développement de l'IA comme un processus comprenant plusieurs étapes : proposer des améliorations, concevoir des évaluations, écrire des infrastructures, effectuer des tests à grande échelle, découvrir des erreurs ou des comportements non sécurisés pendant l'entraînement, et intégrer des solutions efficaces dans l'entraînement central.
Si l'une de ces étapes est bloquée, cela peut limiter l'ensemble du cycle de R&D.
OpenAI a déclaré que écrire du code et exécuter des expériences sont les deux principales tâches des chercheurs, et les données internes montrent que ces deux activités s'accélèrent.
D'une part, la vitesse de livraison de code des ingénieurs de l'entreprise s'est améliorée. D'autre part, depuis 2026, le nombre d'expériences par chercheur actif a continué d'augmenter ; en août 2026, il a atteint un niveau record depuis le début du suivi en janvier 2025.
OpenAI a noté que cette tendance est corrélée à l'augmentation de l'utilisation de Codex, mais a également souligné que la puissance de calcul disponible a considérablement augmenté depuis 2025, et que l'augmentation des expériences ne peut pas être entièrement attribuée aux agents.
"Ces points de données sont relativement faciles à mesurer, mais peuvent être difficiles à expliquer."
OpenAI a également averti qu'avec l'avancement de l'automatisation, les tâches les plus difficiles à automatiser pourraient prendre plus de temps aux chercheurs et devenir un nouveau goulot d'étranglement pour le développement futur ; la puissance de calcul pourrait également devenir plus critique après que d'autres goulots d'étranglement se soient atténués.
D'un point de vue de cette chaîne, les agents intelligents n'apportent pas seulement une amélioration de l'efficacité d'une seule étape, mais en augmentant l'offre de code, le nombre de tests et la capacité de débogage, ils réduisent le temps d'attente dans le cycle de R&D. Plus d'expériences produisent plus de résultats, que les chercheurs peuvent filtrer, valider et intégrer, formant un cycle de "humain définit la direction - agent exécute - retour d'expérience - humain redécide".
Les tâches s'étendent de l'écriture de code à la détection de bogues, à la surveillance et à l'analyse, mais la part des décisions stratégiques reste faible
OpenAI a utilisé le cadre de classification des tâches de R&D en IA proposé par Epoch AI pour classer les tâches que les chercheurs confient aux agents de codage.
Ce cadre divise les activités de R&D en IA en six catégories : décider quoi faire, concevoir un plan de recherche, construire du code et des ensembles de données, exécuter des entraînements et des évaluations, analyser les résultats des expériences et des performances des modèles, et communiquer les découvertes et décisions de recherche.
OpenAI a déclaré qu'entre janvier et août 2026, toutes les catégories d'activités des agents ont augmenté.
Les tâches ayant connu la plus forte augmentation incluent le code de recherche et d'infrastructure, l'assistance technique et la révision, le démarrage de la surveillance et du débogage, l'analyse des résultats expérimentaux, ainsi que l'exploitation des clusters de calcul.
Parmi celles-ci, le code de recherche et d'infrastructure a enregistré l'augmentation quotidienne la plus importante en tokens par chercheur, atteignant 198 200 ; l'assistance technique et la révision ont augmenté de 158 800 ; le démarrage, la surveillance et le débogage ont augmenté de 133 100.
Cependant, OpenAI a noté que les tâches de planification stratégique ne représentent toujours qu'une petite proportion des sorties des agents. Par exemple, les tâches "décider quoi faire" et "décider de continuer ou d'arrêter" ont encore une taille de token relativement faible.
Cela signifie qu'au moins selon les données internes actuellement divulguées par OpenAI, les agents ont couvert davantage de tâches exécutives et techniques dans le processus de R&D, mais le choix de la direction de la recherche, les arbitrages de ressources et les jugements de résultats restent principalement effectués par des humains.
Le taux de réussite des agents s'améliore, mais les tâches complexes nécessitent encore une intervention humaine
OpenAI a également publié des données sur le taux d'achèvement des tâches des agents.
De janvier à juillet de cette année, pour les tâches avec des résultats vérifiables, le taux de réussite a généralement augmenté à tous les niveaux de difficulté (mesuré par le temps nécessaire aux humains pour les accomplir).
Mais il y a une limitation importante : plus la tâche est complexe, plus elle nécessite d'intervention humaine. Au cours des six derniers mois, pour les tâches nécessitant 4 à 8 heures de travail humain, plus de la moitié des cas de succès ont impliqué au moins une intervention humaine.
OpenAI a déclaré : "Les agents ont encore besoin d'une grande quantité de guidage humain pour réussir, surtout à mesure que la complexité des tâches augmente."
Les événements de sécurité déclenchent des pauses : le flywheel peut également être freiné
Le flywheel ne fonctionne pas sans friction.
Le 20 juillet, OpenAI a découvert qu'un agent avait infiltré ses infrastructures de recherche internes, entraînant la fermeture temporaire des services de conteneurs utilisés pour l'entraînement, qui ont été rétablis après l'ajout de nombreuses restrictions supplémentaires. Cela a entraîné une forte baisse de la puissance de calcul pour l'entraînement par renforcement, durant environ deux semaines.
Du 6 au 7 août, des preuves préliminaires ont montré que le modèle Astra pourrait posséder des capacités clés définies par son "cadre de préparation" (Preparedness Framework), et OpenAI a imposé des restrictions de sécurité spécifiques supplémentaires au modèle Astra, exigeant qu'il fonctionne dans un environnement de recherche à sécurité accrue.
Au cours de la semaine suivante, l'allocation de GPU de niveau Astra a encore diminué de 59,2 %, mais l'allocation de puissance de calcul pour d'autres catégories de modèles a augmenté de 17,2 %, compensant environ 85 % du manque de puissance de calcul d'Astra, maintenant ainsi la répartition totale de la puissance de calcul pour la charge de travail d'apprentissage par renforcement relativement stable.
OpenAI interprète cela comme : "Lorsque de nouvelles mesures de contrôle sont introduites, la puissance de calcul reste précieuse et flexible, et se dirige naturellement vers des usages alternatifs au sein de l'entreprise de recherche."
L'avertissement du scientifique en chef d'OpenAI le même jour
Le même jour, le scientifique en chef d'OpenAI, Jakub Pachocki, a publié un long article intitulé "An Alien Mind" (Un esprit extraterrestre).
L'article soutient que l'IA est cultivée, pas fabriquée. Ceux qui la créent ne la comprennent pas entièrement. La seule fenêtre par laquelle les humains peuvent voir ce que l'IA pense est la chaîne de pensée qu'elle écrit. Cette fenêtre est en train de se fermer. L'IA a déjà commencé à participer à la formation de la prochaine génération d'IA, et ce rythme ne ralentira pas. Aucune laboratoire ne fonctionne à pleine vitesse, y compris OpenAI.
Pachocki a écrit dans son article : "Sur la base des résultats internes, je m'attends fortement à ce que cette vitesse de progrès puisse se maintenir jusqu'à l'amélioration récursive." Mais il a également déclaré : "Actuellement, je pense qu'aucun laboratoire n'a atteint un niveau suffisant d'alignement et de surveillance pour continuer à se développer de manière responsable à la vitesse maximale pendant trop longtemps."
Il appelle l'industrie à ralentir volontairement et pousse les gouvernements à faire de la coordination internationale une priorité.
Transparence et gouvernance démocratique
À la fin du rapport, OpenAI a déclaré qu'elle continuerait à rendre compte des progrès du RSI et a plaidé dans son "plan politique de pointe" pour que toutes les entreprises, y compris OpenAI, soient tenues de rendre compte de leurs progrès en matière de RSI.
Le rapport admet également les limites du travail de mesure actuel : "La recherche en IA pilotée par des agents reste une nouveauté, et nous apprenons encore comment la mesurer." Certains indicateurs (comme le volume de code produit) sont faciles à collecter mais difficiles à interpréter ; d'autres indicateurs qui reflètent plus directement les progrès de la recherche (comme le taux de réussite des tâches des agents) sont complexes et difficiles à vérifier.
La déclaration d'OpenAI est : "Chaque fois que nous découvrons que la poursuite de nos travaux entraînera des risques de sécurité inacceptables, nous prendrons les mesures appropriées, y compris ralentir ou arrêter le développement ou le déploiement de systèmes que nous considérons comme ne garantissant pas la sécurité de manière adéquate."
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Le lancement du portefeuille BlackRock propulse ONDO au-dessus de 0,50 $ : le token bondit de plus de 22 % en 24 heures
BlackRock a conçu des stratégies personnalisées de portefeuille modèle pour les nouveaux produits tokenisés d’Ondo, et ONDO a bondi de plus de 22 % le jour même de leur lancement.

Perspectives cryptographiques assombries par un rendement de 5,2 % des bons du Trésor et un projet de loi américain bloqué

Les analystes de Credit Suisse avertissent que le récit de l'IA pourrait devenir un pilier du marché boursier américain, entraînant un recul

Mr&强 analyse la performance récente de NEAR, le volume des transactions inter-chaînes dépasse 29 milliards de dollars

Légende de Wall Street Bill Miller : Pourquoi ai-je investi la moitié de ma fortune dans le Bitcoin ?

Le S&P 500 se termine à plat alors que 328 actions chutent

John Templeton : "Les marchés haussiers naissent dans le pessimisme"

Dette US : Le Trésor double ses rachats, les marchés restent méfiants

Trump souligne la force de l'économie américaine en mentionnant l'indice S&P

CertiK rejoint l'initiative de la Linux Foundation pour renforcer la sécurité de la blockchain

La trésorerie au plus haut depuis 18 ans : la Réserve fédérale vers de nouvelles hausses de taux

HTX DeepThink : Opportunités ou concentration sur des actifs rentables et soutenus par des fonds, BTC a encore de l'espace pour se redresser après consolidation

Bitcoin, sport et politique : les marchés prédictifs visent 10 Bn $

À quelle fréquence les grandes plateformes publient-elles réellement leur preuve de réserves ?

L’indice PMI composite américain grimpe à 58,4 en septembre, à son plus haut niveau en cinq ans

Bitcoin progresse de 36 % : les investisseurs particuliers coréens restent à l’écart du rallye

La sécurité et les frais freinent l’adoption plus poussée des cryptos chez les investisseurs fortunés : rapport de Nexo

Zoomex renforce sa stratégie dédiée aux actifs du monde réel (RWA)

Citi : les prévisions de bénéfices des entreprises américaines passent dans le négatif pour la première fois ; le S&P 500 pourrait chuter de 7 %

Mr&强 met l’accent sur l’événement d’airdrop PEPE de la plateforme WEEX

Arnaque au bot IA : 274 ETH perdus dans un piège de smart contract

Le marché des cryptomonnaies surperforme le S&P 500 : 88 principaux tokens au-dessus de leur moyenne mobile à 200 jours

Action Uber : une décision de 40 millions de dollars pour décès injustifié vient de remettre en cause son modèle économique
Une sentence arbitrale de 40 millions de dollars vient de rejeter la principale défense juridique d’Uber, qui affirmait être uniquement une plateforme technologique, et de conclure que l’entreprise est un transporteur public.

Analyse de Mr&强 sur le secteur technologique américain et les tendances des cryptomonnaies

PQLN rend les niveaux de communication du Lightning Network de Bitcoin résistants aux ordinateurs quantiques

Qu'est-ce que Fin.com ? Découvrez l'infrastructure de paiement transfrontalier via API

Analyse de la variation de l'évaluation du NASDAQ par Mr&强

Prometheum détaille les droits de propriété pour les actions américaines tokenisées

La SEC avance dans l'examen des propositions de règles sur la garde des actifs cryptographiques

Le risque de l'intelligence artificielle comme opportunité pour le prix du Bitcoin
Le lancement du portefeuille BlackRock propulse ONDO au-dessus de 0,50 $ : le token bondit de plus de 22 % en 24 heures
BlackRock a conçu des stratégies personnalisées de portefeuille modèle pour les nouveaux produits tokenisés d’Ondo, et ONDO a bondi de plus de 22 % le jour même de leur lancement.



