
Des notes internes de Microsoft émergent dans le litige sur l'entraînement d'OpenAI avec des contenus d'actualité

Des notes internes de Microsoft émergent dans le litige sur l'entraînement d'OpenAI avec des contenus d'actualité
WEEX View
- La prochaine variable clé est de savoir si l'affaire se jouera sur des arguments généraux d'usage équitable ou sur des questions plus ciblées concernant les contenus payants, la provenance des données et la réutilisation pour l'entraînement de modèles de contenus obtenus à une autre fin.
- Les marchés devraient également surveiller si les divulgations judiciaires poussent davantage d'éditeurs vers des accords de licence ou des litiges. Les contenus d'actualité figurent parmi les catégories de données d'entraînement les plus difficiles à défendre, car ils font l'objet de licences commerciales et peuvent se substituer directement au produit d'origine.
- Tout indice montrant que les droits de réentraînement, les restrictions sur les jeux de données ou les limites du consentement peuvent être applicables aurait des répercussions au-delà de cette affaire, en particulier pour les entreprises d'IA qui dépendent de chaînes de données tierces et de partenariats avec des entreprises.
Des documents judiciaires dans le cadre de la plainte du New York Times contre OpenAI et Microsoft révèlent des discussions internes chez Microsoft sur la question de savoir si l'utilisation d'articles de presse pour entraîner des modèles d'IA constituait un détournement massif du travail créatif, tandis que les deux entreprises continuent d'affirmer que l'entraînement concerné est protégé au titre de l'usage équitable.
Les éléments récemment révélés comprennent une note de 2023 de Brent Hecht, directeur des sciences appliquées chez Microsoft, décrivant les grands modèles d'IA comme des « produits qui détruisent leurs propres chaînes d'approvisionnement » et avertissant que de nombreuses personnes considéraient ces systèmes comme une appropriation sans précédent de leur travail. Les documents judiciaires citent également sa description de la copie sans autorisation de millions d'articles de presse comme « le plus grand vol de travail de l'histoire de l'humanité ».
Microsoft a déclaré que ces notes reflétaient l'effort de Hecht visant à présenter des « perspectives différentes et asymétriques » et ne représentaient pas la position officielle de l'entreprise. Cette distinction est importante, car l'affaire ne porte pas sur une campagne publique menée par un employé, mais sur des communications internes que les plaignants utilisent pour soutenir que les entreprises comprenaient la sensibilité juridique et commerciale de l'entraînement sur des contenus d'éditeurs.
Selon les documents déposés, le directeur général de Microsoft, Satya Nadella, a témoigné que les contenus derrière un paywall ne devraient être utilisés qu'avec l'autorisation des détenteurs de droits. Il a également déclaré que, s'il avait su à l'avance qu'OpenAI utilisait des contenus payants pour l'entraînement, il aurait exercé les droits de Microsoft pour exiger le réentraînement du modèle. D'autres documents judiciaires citent aussi un employé d'OpenAI évoquant une « méthode de pirate informatique » pour contourner le paywall du New York Times dans un message adressé au président Greg Brockman, qui a répondu : « Bien. »
OpenAI et Microsoft soutiennent tous deux que l'entraînement des modèles concernés relève de l'usage équitable. Le différend a commencé lorsque le New York Times a déposé plainte à la fin de 2023, et le rapport initial indique que 11 éditeurs ont depuis rejoint l'affaire. En l'absence d'éléments vérifiés suffisants au-delà des divulgations judiciaires, plusieurs détails de fond restent non résolus, notamment l'étendue complète des jeux de données concernés et la manière dont le tribunal évaluera l'autorisation, les limites des licences et le préjudice pour le marché.
Pourquoi c'est important
Cette affaire dépasse le risque réputationnel pour deux grandes entreprises d'IA. Elle touche à l'une des principales questions juridiques auxquelles est confrontée l'IA générative : l'entraînement sur des textes ayant une valeur commerciale peut-il être considéré comme un usage transformateur lorsque les contenus sources sont expressifs, sous licence et, dans certains cas, protégés par un paywall ? L'édition d'actualités constitue un test particulièrement sensible, car il existe un véritable marché pour l'octroi de licences sur ces contenus et une crainte claire que les productions de l'IA puissent concurrencer le produit d'origine.
Ces révélations renforcent également l'enjeu de conformité pour l'infrastructure d'IA au sens large. Si les tribunaux accordent davantage de poids au consentement, aux restrictions liées aux sources ou à la réutilisation de données acquises selon des conditions différentes, les développeurs et leurs partenaires pourraient être soumis à des contrôles plus stricts sur la manière dont les corpus d'entraînement sont constitués, partagés et mis à jour.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
À propos de WEEX View
WEEX View est un hub d'analyse crypto, couvrant les dernières actualités du Web3, de l'IA et des marchés mondiaux. Accédez à des recherches indépendantes et des analyses approfondies pour anticiper les tendances de marché et les opportunités de trading.
Derniers articles
PlusLa plainte de KelpDAO contre Bryan Pellegrino fait suite à l'exploit rsETH de 292 millions de dollars
KelpDAO aurait poursuivi le PDG de LayerZero, Bryan Pellegrino, après l'exploit rsETH, tandis que le rapport d'incident de LayerZero attribue la perte de 116 500 rsETH à l'ingénierie sociale et à une configuration à vérificateur unique.
La résolution brésilienne 588 confirme le durcissement des règles AML sur les cryptos
La résolution brésilienne 588 est officiellement enregistrée comme une modification LCB-FT de la circulaire 3.978/2020, tandis que le signalement rapporté des portefeuilles auto-hébergés à partir de 10 000 $ et les restrictions de la résolution 589 nécessitent encore le texte opérationnel complet.
Le rapport sur le piratage de Bitget met l’accent sur les retraits et la couverture des fonds
Bitget aurait confirmé un piratage ayant affecté environ 351,6 millions de dollars le 24/09/2026, les retraits ayant été suspendus pour examen. Les informations publiées sur les réserves et le fonds de protection apportent du contexte, mais la confirmation liée au même événement reste non résolue.
JC 2026 29 signale un risque quantique pour la cryptographie de Bitcoin
JC 2026 29 inscrit l’informatique quantique sur la carte des risques de supervision de l’UE pour la cryptographie liée aux cryptoactifs, tandis que la Commission européenne indique que les États membres devraient entamer la transition vers la cryptographie post-quantique d’ici fin 2026 et protéger l...

