La bourde stupéfiante d’OpenAI : une preuve essentielle disparaît dans le procès du New York Times

News graphic featuring the logo of OpenAI.

Image: eWeek

Written By
Sunny Yadav
Sunny Yadav
Dec 3, 2024
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenAI est dans la tourmente après que des ingénieurs ont accidentellement effacé des données essentielles dans le cadre d’un procès aux enjeux considérables intenté par The New York Times et Daily News. La plainte accuse OpenAI d’avoir utilisé des articles protégés par le droit d’auteur pour entraîner ses modèles d’IA sans autorisation, ce qui pourrait constituer une violation de la législation sur le droit d’auteur. Selon des documents judiciaires, la suppression des données a contraint les plaignants à recommencer plusieurs semaines de travail, à un coût important.

Les données effacées provenaient de l’une des deux machines virtuelles qu’OpenAI avait fournies aux plaignants afin qu’ils puissent rechercher leurs contenus protégés par le droit d’auteur dans les jeux de données d’entraînement de son IA. Les machines virtuelles, souvent utilisées à des fins de test et de sauvegarde, permettaient à l’équipe juridique des plaignants d’examiner en détail les données d’entraînement. Toutefois, le 14 novembre, des ingénieurs d’OpenAI ont effacé le contenu de l’une des machines, rendant les données récupérées incomplètes et inutilisables pour retracer la manière dont les contenus des plaignants avaient été intégrés à les modèles d’OpenAI.

Le différend sur la responsabilité de la perte de données

OpenAI a attribué le problème à une « mauvaise configuration du système » demandée par les plaignants, affirmant que cette modification avait involontairement supprimé les noms de fichiers et les arborescences de dossiers d’un lecteur de cache temporaire. Les avocats d’OpenAI ont nié que des fichiers aient été définitivement perdus et ont maintenu que la suppression était involontaire.

Toutefois, les avocats des éditeurs affirment que l’incident souligne la capacité supérieure d’OpenAI à effectuer des recherches dans ses propres jeux de données. « Les plaignants issus du secteur de l’information ont été contraints de refaire leur travail depuis zéro, en mobilisant un nombre considérable d’heures de travail et de temps de calcul », ont-ils écrit, ajoutant que cette perte avait retardé leur procédure et accru les coûts.

Des conséquences plus larges pour le droit d’auteur et l’IA

Le procès met en lumière la tension croissante entre les créateurs de contenus et les développeurs d’IA. The New York Times et Daily News affirment que l’utilisation de leurs articles par OpenAI dépasse le cadre de l’« usage loyal », estimant qu’elle confère un avantage déloyal dans le développement de modèles d’IA commerciaux. Les plaignants réclament des milliards de dollars de dommages et intérêts, accusant OpenAI d’avoir utilisé leurs œuvres sans autorisation.

Advertisement

OpenAI, qui a conclu des accords de licence avec d’autres grands éditeurs comme Axel Springer et Dotdash Meredith, n’a pas indiqué si ses modèles d’IA avaient été spécifiquement entraînés sur les contenus des plaignants. OpenAI maintient que l’entraînement de modèles à partir de données accessibles au public, notamment les articles de presse, relève de l’usage loyal.

Et maintenant ?

À mesure que la procédure avance, la perte de données pourrait constituer un obstacle majeur pour les plaignants. Alors qu’OpenAI s’emploie à déposer sa réponse, le débat juridique plus large sur l’utilisation de contenus protégés par le droit d’auteur par les entreprises d’IA reste irrésolu. Avec des dommages et intérêts potentiels se chiffrant en milliards, l’issue de cette affaire pourrait établir un précédent déterminant pour l’avenir du développement de l’IA et des droits de propriété intellectuelle.

Sunny Yadav

Sunny is a content writer for eSecurity Planet (eSP) with a bachelor’s degree in technology and experience writing for leading cybersecurity brands like Panda Security, Upwind, and Vanta. At eSP, he covers the latest news on cyberattacks, cryptography, data protection, and emerging threats and vulnerabilities. He also explores security policies, governance, and endpoint and mobile security. Sunny enjoys hands-on testing, rigorously evaluating tools to assess their capabilities and real-world performance. He also has extensive experience working with AI tools like ChatGPT and Gemini, experimenting with their applications in cybersecurity, content creation, and research.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.