Reddit Limits Internet Archive Access to Curb AI Data Scraping and ‘Protect Redditors’

Reddit logo.

Reddit logo. Image: Unsplash/Brett Jordan

Written By
J.R. Johnivan
J.R. Johnivan
Aug 13, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Reddit a commencé à empêcher The Internet Archive (IA) d’archiver la majeure partie de sa plateforme. L’entreprise explique que cette décision a été motivée par la crainte que des développeurs d’IA récupèrent des données provenant de Reddit à partir de pages archivées, ce que l’IA n’a pas été en mesure d’empêcher. 

Qu’est-ce que The Internet Archive ?

The Internet Archive existe depuis plus longtemps que Google, Facebook et LinkedIn. Fondé en 1996, le service a été conçu pour offrir au public un accès libre à la collection croissante d’informations disponibles sur Internet.

L’une de ses fonctionnalités les plus connues, la Wayback Machine, a été lancée en 2001. Si l’IA préserve un large éventail de contenus en ligne, la Wayback Machine permet spécifiquement aux utilisateurs de voir des sites web tels qu’ils se présentaient à certaines dates, même si les originaux ont été supprimés ou modifiés.  

Aujourd’hui, l’IA affirme avoir préservé plus de 835 milliards de pages web, ainsi que des livres, des images, des vidéos, des applications et des fichiers audio.

Comprendre le différend

L’IA archivait régulièrement des contenus de Reddit, notamment les publications originales et les fils de commentaires associés aux profils des utilisateurs. Même lorsqu’une publication était supprimée par son auteur d’origine, un instantané restait souvent disponible sur la Wayback Machine. Les profils d’utilisateurs supprimés étaient même accessibles dans les archives. Si n’importe quel utilisateur de Reddit suffisamment à l’aise avec la technologie pouvait facilement trouver ces informations, le véritable problème est apparu lorsque des bots automatisés ont commencé à utiliser l’IA pour extraire des données afin de les utiliser dans leurs propres modèles d’IA.

Le problème s’est aggravé lorsque des programmes automatisés ont commencé à utiliser ces archives pour recueillir de grandes quantités de données destinées à l’entraînement de l’IA. La plateforme interdisant l’extraction automatisée sans autorisation, Reddit estime qu’il n’avait guère d’autre choix que de limiter l’accès de l’IA lorsque les archives ne pouvaient pas bloquer ces activités de manière fiable.

Advertisement

Tim Rathschmidt, porte-parole de Reddit, a été récemment cité comme ayant déclaré : « Tant qu’ils ne seront pas en mesure de protéger leur site et de respecter les règles de la plateforme (par exemple, en respectant la vie privée des utilisateurs et en supprimant les contenus retirés), nous limitons une partie de leur accès aux données de Reddit afin de protéger les redditeurs. »

Cette restriction ne coupe pas totalement l’accès à l’IA : la Wayback Machine peut toujours capturer la page d’accueil de Reddit, mais pas les publications complètes, les commentaires ou les pages de subreddits.

D’autres sites vont-ils lui emboîter le pas ?

Ce changement intervient un peu plus d’un an après que Reddit a déclaré qu’il n’empêcherait pas les « acteurs de bonne foi », comme l’IA, d’accéder à ses contenus.

Reddit insiste sur le fait que ce blocage résulte de l’utilisation de l’IA et de la Wayback Machine par des bots d’IA pour extraire des données. Cependant, certains critiques — qui citent le projet récent de Reddit d’introduire des subreddits payants — y voient un moyen pour la plateforme de réseaux sociaux de garantir une transition en douceur vers la monétisation des contenus à l’avenir. D’autres l’attribuent à l’accord de licence récemment conclu par Reddit avec Google et OpenAI.

Quelle que soit la véritable raison de Reddit, il sera intéressant de voir si d’autres plateformes de réseaux sociaux suivront son exemple.

Lisez notre article consacré au procès intenté par Reddit à Anthropic et aux raisons pour lesquelles il pourrait créer un précédent quant à la manière dont les entreprises d’IA se procurent leurs données.

J.R. Johnivan

J.R. Johnivan is a 17-year veteran whose writing is focused on innovation and technology, including IT, computer networking, security, cloud computing, staffing, human resources, real estate, sports, entertainment, and more.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.