La plateforme de réseaux sociaux Reddit a intenté une action en justice pour violation du droit d’auteur contre la start-up spécialisée dans l’intelligence artificielle Perplexity, l’accusant d’avoir aspiré illégalement les publications et commentaires de millions d’utilisateurs de Reddit.
Dans sa plainte, Reddit affirme que Perplexity s’appuie sur le contenu de ses forums pour alimenter son modèle d’IA générative. La plupart des grands chatbots ont aspiré Reddit d’une manière ou d’une autre, compte tenu de l’immense bibliothèque de discussions spécialisées et de données conversationnelles de la plateforme, réparties entre des milliers de communautés.
Ce n’est pas la première action en justice intentée par Reddit contre une entreprise d’IA. En juin, elle a engagé une procédure similaire contre Anthropic, qui est toujours en cours.
« Les entreprises d’IA se livrent une course effrénée au contenu humain de qualité, et cette pression a alimenté une économie industrielle de blanchiment des données », a déclaré Ben Lee, Reddit’s chief legal officer. « Reddit est une cible de choix, car il s’agit de l’une des collections de conversations humaines les plus vastes et les plus dynamiques jamais créées. »
Reddit a également poursuivi trois entreprises qui fournissent des services d’aspiration de données à des clients, notamment à des développeurs d’IA. Il s’agit de la société lituanienne Oxylabs, de la société russe AWMProxy et de la société texane SerpApi, qui mentionne Perplexity comme client sur son site web.
Les accords de droit d’auteur perçus comme une source de revenus
La position de Reddit semble justifiée, puisque plusieurs entreprises d’IA ont déjà signé des accords de licence de droit d’auteur avec la plateforme. Parmi elles figurent Google et OpenAI, qui ont conclu des accords en février et en mai 2024 pour accéder aux données de Reddit afin d’alimenter leurs modèles d’IA.
Cependant, comme l’a indiqué Perplexity dans une déclaration publiée sur Reddit, rien ne permet de savoir si ces entreprises continueront à payer des licences d’accès aux données maintenant que le contenu de Reddit publié entre 2005 et 2024 a déjà servi à entraîner leurs modèles.
« Pourquoi poursuivre Perplexity ? Notre hypothèse : il s’agit de faire une démonstration de force dans les négociations de Reddit avec Google et OpenAI sur les données d’entraînement », a déclaré l’entreprise. « Voici sur quel point nous nous opposons. Reddit a déclaré à la presse que nous l’avions ignoré lorsqu’il nous avait interrogés sur les licences. C’est faux. Chaque fois que quelqu’un nous interroge sur les licences de contenu, nous expliquons que Perplexity, en tant qu’entreprise opérant au niveau applicatif, n’entraîne pas de modèles d’IA sur du contenu. Il y a un an, après cette explication, Reddit a insisté pour que nous payions quand même, alors même que nous accédions légalement aux données de Reddit. Céder à des tactiques d’intimidation n’est tout simplement pas notre façon de faire des affaires. »
Ce ne serait pas la première fois que Perplexity est accusée d’employer des méthodes déloyales pour aspirer des données. En août, l’entreprise de sécurité web Cloudflare a accusé la start-up d’utiliser des outils d’aspiration discrets et non déclarés pour contourner les sites web appliquant des politiques interdisant l’exploration.
Avec les poursuites engagées contre Perplexity et Anthropic, Reddit pourrait contribuer à établir un précédent sur la manière dont les entreprises d’IA se procurent des données sur le web pour entraîner leurs modèles. Dans le cas de Perplexity, qui fonctionne davantage comme un moteur de recherche que comme un chatbot tel que ChatGPT ou Gemini, la question pourrait être de savoir si de tels services peuvent fournir des liens, des extraits et des synthèses de contenu provenant de sites comme Reddit sans le consentement préalable du propriétaire du contenu.
Jusqu’à l’essor de l’IA générative, Reddit ne semblait pas mesurer pleinement la valeur de ses contenus générés par les utilisateurs. Ces dernières années, toutefois, l’entreprise s’est efforcée de faire des licences de données un élément clé de son activité, aux côtés de la publicité. Dans ce but, elle a bloqué The Internet Archive, les créateurs de la Wayback Machine, afin de les empêcher d’archiver son contenu en août.
Cela reste un cas d’école intéressant pour la propriété et la distribution des contenus, notamment parce que, contrairement à Hollywood, à la RIAA ou aux éditeurs de presse qui ont poursuivi des entreprises d’IA, la quasi-totalité du contenu de Reddit provient de ses utilisateurs.
Les recherches sur l’IA et les contenus montrent qu’en novembre 2024, 50,3 % des nouveaux articles du web étaient générés principalement par l’IA. Cependant, avant l’arrivée de ChatGPT, ce chiffre n’était que de 5 %.

