« Le plus grand vol de travail de l’histoire » : quand les documents internes de Microsoft plaident contre Microsoft
Il existe dans tout procès un moment redouté des avocats : celui où la partie adverse n’a plus besoin d’argumenter, parce qu’elle se contente de citer vos propres courriels. Microsoft et OpenAI viennent de vivre ce moment. Un mémoire de 92 pages, déposé par les éditeurs de presse dans le contentieux consolidé sur le droit d’auteur qui les oppose à OpenAI et Microsoft devant le juge fédéral Sidney H. Stein à New York, a été rendu public dans une version beaucoup moins caviardée le jeudi 17 septembre. Son contenu fait, depuis, le tour des rédactions. Et pour cause : les formules les plus dures ne viennent pas des plaignants, mais des équipes des défendeurs.
Une citation qui va voyager (et qu’il faut remettre à sa place)
Le document s’ouvre sur deux phrases d’un même auteur, Brent Hecht, directeur des sciences appliquées chez Microsoft. Dans un premier écrit interne, il anticipe que le public finira par percevoir l’aspiration de ses œuvres par les grands modèles comme un vol d’une ampleur inédite. Dans un second, il va plus loin et qualifie l’entraînement des modèles de ce qui serait peut-être « le plus grand vol de travail de l’histoire humaine ».
Avant que la formule ne se retrouve imprimée sur des tee-shirts, une précision s’impose. Brent Hecht est un chercheur, pas un membre du comité de direction, et encore moins Satya Nadella. Microsoft l’a d’ailleurs rappelé au Financial Times : ces propos refléteraient la position personnelle d’un salarié et ne constitueraient en rien une analyse juridique. L’argument est recevable. Il l’est un peu moins lorsque l’on découvre que d’autres documents de l’entreprise tiennent un discours très proche, chiffres à l’appui.
Rappelons aussi qui sont les plaignants. Il ne s’agit pas seulement du New York Times, mais aussi du groupe Daily News, du Center for Investigative Reporting et de Ziff Davis, l’éditeur de CNET, ZDNET, PCMag et Mashable. Autrement dit, une bonne partie de la presse technologique que nos lecteurs consultent chaque matin.
La « boucle fatale », version Microsoft
Le cœur technique du dossier tient dans une expression tirée d’un document interne de Microsoft : la stratégie de contenus IA de l’entreprise aurait enclenché une « doom loop », une boucle fatale susceptible d’abîmer à la fois ses propres modèles et le web dans son ensemble. Le mécanisme est connu de tout architecte qui a déjà dessiné une chaîne d’approvisionnement : un produit final qui asphyxie ses fournisseurs finit par manquer de matière première.
Les chiffres cités proviennent des données de Microsoft elles-mêmes et comparent Copilot à une recherche Bing classique. Le taux de clics vers les sites des éditeurs chuterait de 87 à 93 % pour le New York Times, de 83 à 91 % pour le groupe Daily News, et de 51 à 94 % pour les titres de Ziff Davis. La fourchette « 51 à 94 % » souvent reprise ne concerne donc que Ziff Davis ; pour les deux autres plaignants, la baisse n’est jamais inférieure à 83 %. On a connu des démonstrations plus rassurantes.
Brent Hecht détaille le raisonnement dans une note rédigée peu après le dépôt de la plainte. Un modèle de langage fonctionne en reproduisant les régularités statistiques de son corpus d’entraînement, et rien dans cette architecture ne prévoit de faire redescendre la valeur économique vers ceux qui ont produit ce corpus. Conséquence logique selon lui : la stabilité économique des créateurs de contenus est structurellement menacée. Il ajoute qu’une victoire de son employeur sur le terrain du « fair use » risquerait de vider cette notion de son sens. Un autre document résume l’affaire en une phrase que les avocats des éditeurs ont dû encadrer : les LLM seraient un produit qui détruit sa propre chaîne d’approvisionnement.
« Les utilisateurs ne cliqueront pas »
Côté OpenAI, le mémoire n’est pas plus tendre. Un ingénieur logiciel non nommé y constate que, quelle que soit la mise en avant des liens vers les sources, les utilisateurs ne cliquent pas. C’est précisément la promesse que les acteurs de l’IA générative font aux éditeurs depuis deux ans (« nous citons nos sources, nous vous renvoyons du trafic ») qui se trouve ainsi démentie en interne.
Nick Turley, responsable de ChatGPT, aurait lui-même évoqué une menace existentielle pour les éditeurs, en décrivant les produits comme largement substitutifs, et appelés à l’être davantage à mesure qu’ils s’améliorent. Satya Nadella a reconnu sous serment que les chatbots se substituaient à la consultation de la source. Et certains documents d’OpenAI présentent ChatGPT comme le nouveau kiosque à journaux. Le kiosquier, lui, n’avait pas l’habitude de lire les journaux à voix haute pour éviter aux clients de les acheter.
Ce que les équipes savaient de leurs données d’entraînement
Pour les lecteurs techniques, la partie la plus instructive concerne les jeux de données. Le vice-président de la recherche d’OpenAI y explique sans détour que l’objectif de l’entraînement est de faire mémoriser les données au réseau. Formulée ainsi, la phrase rappelle une réalité que les discours marketing préfèrent taire : la frontière entre apprentissage de régularités et mémorisation de contenus n’est pas étanche, et OpenAI s’inquiétait en interne dès novembre 2019 de la capacité de ses modèles à régénérer des œuvres protégées.
Le mémoire quantifie la présence des contenus des plaignants. Les jeux de données utilisés en phase de « mid-training » contiendraient plus de 91 692 copies de leurs œuvres. WebText2, corpus bien connu des premières générations de GPT, en comptait au moins 6 552 issues du New York Times, 18 609 du groupe Daily News et 66 780 de Ziff Davis. OpenAI aurait par ailleurs obtenu le New York Times Annotated Corpus, soit plus de 1,8 million d’articles publiés entre 1987 et 2007, sous une licence limitée à la recherche non commerciale. L’usage commercial ultérieur de ce type de corpus sera nécessairement scruté.
Le document mentionne enfin un échange qui fait les délices de la presse : un chercheur signale à Greg Brockman une astuce pour contourner le paywall du New York Times, ce à quoi le président d’OpenAI répond par un laconique « ah nice ». Satya Nadella, lui, a déclaré sous serment que tout contenu derrière un paywall devrait faire l’objet d’une licence. Les deux positions cohabitent désormais dans le même dossier.
Le « troc » entre Microsoft et OpenAI
Une section entière du mémoire, intitulée « Horse Trading », décrit les échanges de données entre les deux partenaires. Microsoft aurait collecté des contenus pour Bing, puis les aurait transmis à OpenAI. En retour, OpenAI aurait fourni à Microsoft l’intégralité du jeu de données d’entraînement de GPT-3. Deux initiatives communes, baptisées Taxi et Mango, auraient organisé ces flux, le seul jeu Mango contenant au moins 160 903 œuvres uniques des plaignants.
Pour un DSI, ce point est loin d’être anecdotique. Il illustre à quel point la traçabilité des données d’entraînement (le fameux « data lineage ») reste le maillon faible des grands modèles, y compris chez les acteurs qui en vendent la gouvernance à leurs clients.
Washington et Bruxelles ne lisent pas le même code
Le contexte politique ajoute une couche de complexité. Seize jours avant la levée des caviardages, le gouvernement américain a déposé dans la même procédure une déclaration d’intérêt soutenant que l’entraînement sur des textes protégés relève du fair use. L’argument central distingue l’entraînement, qui ne diffuse rien au public, des sorties du modèle, seules susceptibles de concurrencer l’original lorsqu’elles sont substantiellement similaires. Le document va jusqu’à présenter l’obligation de licence comme un problème de concurrence, puisque seuls les géants technologiques pourraient s’en acquitter. Selon Axios, cette prise de position aurait surpris l’Office des brevets et le Copyright Office, et aucun juriste de carrière de la division antitrust ne l’aurait cosignée.
En Europe, la question est posée à l’envers. La Commission interroge les éditeurs sur l’efficacité du mécanisme d’opt-out proposé par Google pour ses fonctions d’IA, en partant du principe qu’un éditeur doit pouvoir refuser. Le règlement européen sur l’IA et la directive sur le droit d’auteur prévoient d’ailleurs ce droit d’opposition à la fouille de textes et de données. Pendant ce temps, la « boucle fatale » a déjà des effets concrets : le groupe britannique Reach, éditeur du Daily Mirror, vient d’annoncer la suppression de 220 postes éditoriaux en invoquant l’érosion de son trafic par les résumés générés par IA.
Ce que ce mémoire ne prouve pas
L’honnêteté impose de garder la tête froide. Ce document est celui des plaignants : chaque citation a été choisie par des avocats qui construisent un dossier, et les pièces sous-jacentes restent sous scellés. Microsoft conteste l’interprétation des propos de Brent Hecht et estime que le témoignage de Satya Nadella portait sur des principes généraux. OpenAI a déjà qualifié la procédure de tentative d’obtenir un gain indu au détriment d’un progrès profitable à tous.
Sur le fond, la défense dispose d’un argument technique sérieux, porté par son propre expert économiste : un moteur de recherche renvoie une liste classée de liens, alors qu’un modèle ancré sur des sources (le RAG, pour Retrieval Augmented Generation) synthétise l’information récupérée. Reste à savoir si cette synthèse constitue une substitution au sens du droit d’auteur. C’est exactement la question que devra trancher le juge Stein dans sa décision sur le jugement sommaire. Jusqu’ici, les tribunaux américains ont plutôt penché en faveur des acteurs de l’IA, même si Anthropic a préféré transiger pour 1,5 milliard de dollars dans l’affaire des livres piratés plutôt que de tester sa position jusqu’au bout.
Ce que les DSI doivent en retenir
Au-delà du feuilleton judiciaire, trois enseignements concernent directement les directions informatiques qui déploient Copilot ou d’autres assistants génératifs.
Le premier est contractuel. Microsoft propose depuis 2023 son Customer Copyright Commitment, qui couvre les clients commerciaux contre certaines réclamations liées aux sorties de Copilot, sous réserve du respect des garde-fous prévus. C’est le moment de relire précisément le périmètre de cet engagement, les conditions d’activation des filtres de contenu et les usages exclus. Un engagement d’indemnisation vaut ce que valent ses conditions d’application.
Le deuxième est architectural. Si les modèles dégradent l’écosystème des sources ouvertes dont ils dépendent, la qualité des réponses fondées sur le web se dégradera mécaniquement. Pour les usages critiques, l’ancrage sur des corpus internes maîtrisés, gouvernés et datés (SharePoint, Fabric, bases documentaires métiers) devient un avantage compétitif, et non plus une simple option de configuration. Les organisations qui investissent dans la qualité de leurs propres données seront moins exposées à la « boucle fatale ».
Le troisième relève de la gouvernance. Les entreprises sont elles aussi productrices de contenus : documentation publique, livres blancs, bases de connaissances. La question de l’opt-out vis-à-vis des robots d’indexation IA (robots.txt, en-têtes dédiés, mécanismes prévus par le droit européen) mérite d’être posée au même titre que la protection des données personnelles. Après tout, si Microsoft lui-même estime que ses outils peuvent réduire de 90 % le trafic vers une source, la vôtre n’a aucune raison d’être épargnée.
Le juge Stein dispose désormais de deux lectures du même dossier : celle du gouvernement américain, pour qui l’entraînement est transformatif et le préjudice hors du champ du droit d’auteur, et celle des défendeurs eux-mêmes, qui parlaient en interne de vol. Il reste à savoir laquelle le droit retiendra…