AI · 21 septembre 2026
Un cadre de Microsoft a qualifié le scraping de l'IA du « plus grand vol de travail de l'histoire humaine », révèlent de nouveaux documents judiciaires non censurés
Des documents judiciaires récemment déscellés montrent que Microsoft qualifiait en privé les pratiques de données d'OpenAI de « vol », alors que les deux entreprises exploitaient le contenu payant du Times, en construisaient des ensembles de données et s'alarmaient en interne des dégâts que cela causerait aux éditeurs.
Ce qui s'est passé
Des documents judiciaires récemment déscellés révèlent qu'un dirigeant de Microsoft a qualifié en interne les pratiques d'extraction de données d'OpenAI de « plus grand vol de travail de l'histoire humaine ». Ces échanges, dévoilés dans le cadre du litige opposant le New York Times à Microsoft et OpenAI, montrent que les deux entreprises ont aspiré du contenu du quotidien protégé par un abonnement payant afin de constituer des jeux de données d'entraînement pour leurs modèles d'intelligence artificielle.
Selon TechCrunch et Ars Technica, les correspondances internes indiquent que des responsables des deux sociétés étaient conscients, dès le moment des faits, que cette exploitation massive de contenus journalistiques risquait de fragiliser durablement le modèle économique des éditeurs de presse. Ces filings, jusqu'ici partiellement caviardés, apportent un éclairage inédit sur la manière dont les grands acteurs de l'IA ont géré en coulisses la question sensible de la provenance des données d'entraînement.
Pourquoi c'est important
Cette affaire dépasse le seul cadre juridique : elle illustre la tension structurelle entre la course à des modèles d'IA toujours plus performants et le respect des droits de propriété intellectuelle des créateurs de contenu. Le fait qu'un cadre de Microsoft ait lui-même employé un vocabulaire aussi tranché en interne, tout en poursuivant les pratiques incriminées, souligne l'écart entre les discours publics sur une IA « responsable » et les arbitrages opérationnels réels.
Pour les organisations qui déploient ou intègrent des solutions d'IA générative, cette révélation renforce l'urgence d'une gouvernance rigoureuse des données d'entraînement. Elle rappelle aussi aux éditeurs, médias et détenteurs de contenus que la question de la juste valorisation de leurs actifs informationnels reste largement non résolue, avec des répercussions potentielles sur les modèles de licence et de partenariat entre créateurs de contenu et fournisseurs de technologies.
Le point de vue de Renascence
Ce dossier met en lumière un décalage classique entre la rhétorique interne des organisations et leur communication externe — un signal d'alarme pour toute entreprise qui construit sa relation client sur la confiance et la transparence.
Ce que beaucoup retiendront, c'est l'accusation de « vol » ; ce qu'ils manqueront, c'est la leçon de design organisationnel : quand une entreprise sait en interne qu'une pratique est problématique mais continue malgré tout, elle érode silencieusement le capital de confiance qu'elle met des années à construire avec ses parties prenantes. Les opérateurs sérieux en matière d'expérience devraient tirer une conclusion simple : la gouvernance éthique des données ne peut pas rester un exercice de communication — elle doit être auditée, documentée et alignée avec les pratiques réelles, sous peine de voir resurgir, un jour, les preuves de cet écart.
Sources
Ce briefing a été rédigé par notre Newsdesk, synthétisant les reportages des médias ci-dessous. Suivez les liens pour la couverture originale.
Plus sur AI
Gardez une longueur d'avance en CX
Recevez le signal, pas le bruit.
Les histoires qui façonnent l'expérience client — ainsi que le Journal et l'Experience Loom — dans votre boîte de réception.