Meta a récemment été accusée d’entraîner ses modèles d’IA sur des contenus piratés ; aujourd’hui, OpenAI se retrouve empêtrée dans une polémique similaire. Une nouvelle étude affirme que l’un des grands modèles de langage (LLM) les plus récents d’OpenAI a été entraîné sur des contenus protégés par le droit d’auteur et non publics d’O’Reilly Media. Plus précisément, les auteurs de l’étude estiment que les équipes de développement d’OpenAI ont peut-être entraîné l’un de leurs modèles les plus avancés sur des contenus à accès restreint, sans autorisation.
Les auteurs de l’étude écrivent notamment : « Bien que les éléments présentés ici concernant les violations d’accès aux modèles soient spécifiques aux livres d’OpenAI et d’O’Reilly Media, il s’agit probablement d’un problème systémique. »
Examen des accusations
L’étude a été rédigée par une équipe d’O’Reilly Media, dont le PDG Tim O’Reilly. Elle affirme explicitement qu’OpenAI, l’une des principales entreprises d’IA, entraîne l’un de ses modèles d’IA les plus récents sur des contenus verrouillés derrière un paywall via les canaux officiels d’O’Reilly Media.
Les auteurs de l’étude intitulée «Beyond Public Access in LLM Pre-Training Data» sont partis de 34 livres protégés par le droit d’auteur d’O’Reilly Media, dont certains contenus accessibles au public et d’autres derrière un paywall. Ils ont ensuite appliqué la méthode d’attaque par inférence d’appartenance DE-COP, qui permet de déterminer si un modèle d’IA a déjà mémorisé un texte précis, afin d’étudier différents types de modèles d’IA d’OpenAI.
L’équipe a également attribué à chaque LLM un score Area Under the Receiver Operating Characteristic (AUROC). Ce score mesure la probabilité que ces modèles d’IA aient été entraînés à l’aide d’un ou plusieurs des 34 livres protégés par le droit d’auteur d’O’Reilly Media.
- GPT-4o : Démontre une reconnaissance plus forte des contenus non publics d’O’Reilly Media (score AUROC : 82 %) que des contenus publics (score AUROC : 64 %).
- GPT-3.5 Turbo : Démontre une reconnaissance légèrement plus forte des contenus publics d’O’Reilly Media (score AUROC : 64 %) que des contenus non publics (score AUROC : 54 %).
- GPT-4o Mini : Rien n’indique que le modèle ait été entraîné sur des contenus publics ou non publics d’O’Reilly Media.
À y regarder de plus près
Si leur étude innocente initialement GPT-4o Mini de toute violation, elle note que cela pourrait être dû à la taille plus réduite du modèle d’IA et à son incapacité à mémoriser autant de texte que GPT-4o et d’autres outils d’IA générative. Leur étude exprime également une certaine incertitude quant aux scores AUROC, précisant qu’ils doivent être considérés comme des estimations.
L’étude conclut que les méthodes actuelles d’entraînement de l’IA pourraient bientôt conduire à une « impasse extractive ». En ne rémunérant pas les titulaires des droits d’auteur et les créateurs de contenus, les développeurs d’IA finiront par constater une baisse de la qualité, de la précision et de la diversité des contenus.


