Reddit a commencé à empêcher The Internet Archive (IA) d’archiver la majeure partie de sa plateforme. L’entreprise explique que cette décision a été motivée par la crainte que des développeurs d’IA récupèrent des données provenant de Reddit à partir de pages archivées, ce que l’IA n’a pas été en mesure d’empêcher.
Qu’est-ce que The Internet Archive ?
The Internet Archive existe depuis plus longtemps que Google, Facebook et LinkedIn. Fondé en 1996, le service a été conçu pour offrir au public un accès libre à la collection croissante d’informations disponibles sur Internet.
L’une de ses fonctionnalités les plus connues, la Wayback Machine, a été lancée en 2001. Si l’IA préserve un large éventail de contenus en ligne, la Wayback Machine permet spécifiquement aux utilisateurs de voir des sites web tels qu’ils se présentaient à certaines dates, même si les originaux ont été supprimés ou modifiés.
Aujourd’hui, l’IA affirme avoir préservé plus de 835 milliards de pages web, ainsi que des livres, des images, des vidéos, des applications et des fichiers audio.
Comprendre le différend
L’IA archivait régulièrement des contenus de Reddit, notamment les publications originales et les fils de commentaires associés aux profils des utilisateurs. Même lorsqu’une publication était supprimée par son auteur d’origine, un instantané restait souvent disponible sur la Wayback Machine. Les profils d’utilisateurs supprimés étaient même accessibles dans les archives. Si n’importe quel utilisateur de Reddit suffisamment à l’aise avec la technologie pouvait facilement trouver ces informations, le véritable problème est apparu lorsque des bots automatisés ont commencé à utiliser l’IA pour extraire des données afin de les utiliser dans leurs propres modèles d’IA.
Le problème s’est aggravé lorsque des programmes automatisés ont commencé à utiliser ces archives pour recueillir de grandes quantités de données destinées à l’entraînement de l’IA. La plateforme interdisant l’extraction automatisée sans autorisation, Reddit estime qu’il n’avait guère d’autre choix que de limiter l’accès de l’IA lorsque les archives ne pouvaient pas bloquer ces activités de manière fiable.
Tim Rathschmidt, porte-parole de Reddit, a été récemment cité comme ayant déclaré : « Tant qu’ils ne seront pas en mesure de protéger leur site et de respecter les règles de la plateforme (par exemple, en respectant la vie privée des utilisateurs et en supprimant les contenus retirés), nous limitons une partie de leur accès aux données de Reddit afin de protéger les redditeurs. »
Cette restriction ne coupe pas totalement l’accès à l’IA : la Wayback Machine peut toujours capturer la page d’accueil de Reddit, mais pas les publications complètes, les commentaires ou les pages de subreddits.
D’autres sites vont-ils lui emboîter le pas ?
Ce changement intervient un peu plus d’un an après que Reddit a déclaré qu’il n’empêcherait pas les « acteurs de bonne foi », comme l’IA, d’accéder à ses contenus.
Reddit insiste sur le fait que ce blocage résulte de l’utilisation de l’IA et de la Wayback Machine par des bots d’IA pour extraire des données. Cependant, certains critiques — qui citent le projet récent de Reddit d’introduire des subreddits payants — y voient un moyen pour la plateforme de réseaux sociaux de garantir une transition en douceur vers la monétisation des contenus à l’avenir. D’autres l’attribuent à l’accord de licence récemment conclu par Reddit avec Google et OpenAI.
Quelle que soit la véritable raison de Reddit, il sera intéressant de voir si d’autres plateformes de réseaux sociaux suivront son exemple.
Lisez notre article consacré au procès intenté par Reddit à Anthropic et aux raisons pour lesquelles il pourrait créer un précédent quant à la manière dont les entreprises d’IA se procurent leurs données.

