Le bras de fer judiciaire entre le New York Times et le tandem OpenAI-Microsoft entre dans sa troisième année. Déposée fin 2023, la plainte pour violation du droit d’auteur avançait largement à huis clos, une bonne partie des pièces restant scellées. Des pièces fraîchement descellées lèvent le voile sur des échanges internes que les deux entreprises auraient volontiers gardés au chaud.
« Un vol stupéfiant », écrit noir sur blanc
En janvier 2024, Brent Hecht, directeur de la science appliquée de Microsoft, couche son diagnostic par écrit : la collecte massive de contenus qui nourrit les grands modèles relève d’« un vol stupéfiant aux proportions sans précédent ». Quelques lignes plus loin, la formule enfle encore, jusqu’au « plus grand vol de travail de l’histoire de l’humanité ». La formule ferait un excellent slogan de manifestation d’auteurs ; elle émane du cadre d’un groupe qui a englouti des milliards dans OpenAI.
Les pièces versées au dossier alignent des éléments tout aussi gênants. Les jeux de données d’entraînement contenaient plus de 91 692 copies d’articles du quotidien new-yorkais. La plainte soutient également que des équipes d’OpenAI auraient contourné des murs payants grâce à une astuce maison, et que des mentions de droits d’auteur auraient été délibérément retirées des textes aspirés. Nick Turley, le patron de ChatGPT, aurait de son côté reconnu, toujours en interne, que les éditeurs de presse affrontaient une menace « existentielle ».
La ligne de défense publique n’a pourtant pas bougé d’un pouce en trois ans : l’entraînement des modèles relèverait de l’usage loyal (le fameux fair use), cette exception du droit américain (une lecture que l’administration Trump a d’ailleurs épousée). Devant le juge, les messageries internes ne trancheront pas le fond, l’usage loyal restant une affaire de juristes. Côté image, en revanche, l’exercice vire au chemin de croix.
Et pendant ce temps, vos liens bleus s’évaporent
D’après les estimations versées au dossier, Copilot réduirait jusqu’à 93 % les clics vers le site du journal lorsqu’il résume l’information à la place de la page d’origine. Tout internaute a déjà croisé le phénomène : les réponses générées s’installent en haut des résultats de recherche, et les visites qui faisaient vivre les rédactions fondent (celles qui vous ont mené jusqu’ici comprises).
La note interne de Microsoft rejoint par ailleurs une pile de précédents déjà bien garnie : Hachette et deux autres éditeurs accusent Gemini d’avoir pillé des millions de livres, Amazon a découpé des ouvrages pour entraîner ses modèles. La plus populaire des IA musicales, elle, a été entraînée sur des millions de titres. À chaque fois, le même enchaînement : la collecte d’abord, les explications ensuite, l’addition éventuellement.
Si le tribunal suit le raisonnement du New York Times, le modèle économique de l’entraînement devra passer par la case licence, donc par des accords facturés au prix fort (et, en bout de chaîne, par des abonnements IA encore un peu plus chers, devinez pour qui). Le procès n’a pas livré son verdict, mais le dossier a déjà tranché une question : ce que les géants de l’IA pensaient réellement de leurs propres méthodes.
👉🏻 Suivez l’actualité tech en temps réel : ajoutez 01net à vos sources sur Google, et abonnez-vous à notre canal WhatsApp.
Source : Ars Technica

