Reddit verklagt Perplexity wegen des Scraping seiner Daten

A judge bringing order in the court by smashing the gavel.

Image: Enavto

Verfasst von
David Curry
David Curry
Oct 24, 2025
3 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Die Social-Media-Plattform Reddit hat eine Urheberrechtsklage gegen das KI-Startup Perplexity eingereicht und wirft ihm vor, Beiträge und Kommentare von Millionen Reddit-Nutzern illegal abgegriffen zu haben.

In der Klage behauptet Reddit, dass Perplexity Inhalte aus seinen Foren nutzt, um sein generatives KI-Modell zu betreiben. Die meisten großen Chatbots haben Reddit in irgendeiner Form abgegrast, angesichts der umfangreichen Sammlung von Nischendiskussionen und Gesprächsdaten auf der Plattform, die sich über Tausende von Communities erstreckt.

Dies ist nicht die erste Klage, die Reddit gegen ein KI-Unternehmen eingereicht hat. Im Juni hat sie einen ähnlichen Fall gegen Anthropic, der noch läuft. 

„KI-Unternehmen liefern sich ein Wettrüsten um hochwertige menschliche Inhalte, und dieser Druck hat eine Datenwäscheökonomie im industriellen Maßstab befeuert“, sagte Ben Lee, chief legal officer von Reddit. „Reddit ist ein besonders attraktives Ziel, weil es zu den größten und dynamischsten Sammlungen menschlicher Gespräche gehört, die je geschaffen wurden.“

Reddit verklagte außerdem drei Unternehmen, die Kunden, darunter KI-Entwickler, Scraping-Dienste anbieten. Dabei handelt es sich um das in Litauen ansässige Unternehmen Oxylabs, das in Russland ansässige Unternehmen AWMProxy und das in Texas ansässige Unternehmen SerpApi, das Perplexity auf seiner Website als Kunden aufführt.

Urheberrechtsvereinbarungen als Einnahmequelle

Reddits Haltung scheint gerechtfertigt, da mehrere KI-Unternehmen bereits Urheberrechtslizenzvereinbarungen mit der Plattform unterzeichnet haben. Dazu gehören Google und OpenAI, die im Februar beziehungsweise Mai 2024 Vereinbarungen über den Zugriff auf Reddit-Daten für ihre KI-Modelle getroffen haben.

Wie Perplexity in einer auf Reddit veröffentlichten Stellungnahme anmerkte, ist jedoch unklar, ob diese Unternehmen weiterhin für Datenlizenzen zahlen werden, nachdem Reddit-Inhalte aus dem Zeitraum von 2005 bis 2024 bereits zum Training ihrer Modelle verwendet wurden.

„Warum verklagt Reddit Perplexity? Unsere Vermutung: Es geht um eine Machtdemonstration bei Reddits Verhandlungen mit Google und OpenAI über Trainingsdaten“, erklärte das Unternehmen. „Hier widersprechen wir. Reddit sagte der Presse, wir hätten sie ignoriert, als sie wegen einer Lizenzierung auf uns zukamen. Das stimmt nicht. Wann immer uns jemand nach der Lizenzierung von Inhalten fragt, erklären wir, dass Perplexity als Unternehmen auf Anwendungsebene keine KI-Modelle mit Inhalten trainiert. Vor einem Jahr bestand Reddit nach dieser Erklärung trotzdem darauf, dass wir zahlen, obwohl wir rechtmäßig auf Reddit-Daten zugriffen. Einschüchterungstaktiken nachzugeben entspricht einfach nicht unserer Geschäftspraxis.“

Advertisement

Es wäre nicht das erste Mal, dass Perplexity unterstellte Methoden zum Abgreifen von Daten vorgeworfen werden. Das Websicherheitsunternehmen Cloudflare beschuldigte das Startup des Einsatzes heimlicher, nicht offengelegter Scraping-Tools, um im August Websites mit Richtlinien gegen das Crawlen zu umgehen.

Mit den Klagen gegen Perplexity und Anthropic könnte Reddit einen Präzedenzfall dafür schaffen, wie KI-Unternehmen Daten aus dem Web beziehen, um ihre Modelle zu trainieren. Im Fall von Perplexity, das eher als Suchmaschine denn als Chatbot wie ChatGPT oder Gemini funktioniert, könnte die Frage lauten, ob solche Dienste ohne vorherige Zustimmung des Rechteinhabers Links, Ausschnitte und Inhaltsübersichten von Websites wie Reddit bereitstellen dürfen.

Bis zum Aufstieg der generativen KI schien Reddit den Wert seiner nutzergenerierten Inhalte nicht vollständig erkannt zu haben. In den vergangenen Jahren hat das Unternehmen jedoch daran gearbeitet, die Datenlizenzierung neben der Werbung zu einem zentralen Bestandteil seines Geschäfts zu machen. Zu diesem Zweck blockierte es The Internet Archive, die Macher der Wayback Machine, im August daran, seine Inhalte zu archivieren. 

Dies bleibt ein interessanter Testfall für Eigentum und Verbreitung von Inhalten, insbesondere weil im Gegensatz zu Hollywood, der RIAA oder Nachrichtenverlagen, die KI-Unternehmen verklagt haben, fast alle Inhalte von Reddit von seinen Nutzern stammen.

Untersuchungen zu KI und Inhalten zeigen, dass Stand November 2024 50,3 % der neuen Webartikel hauptsächlich von KI generiert wurden. Vor dem Aufkommen von ChatGPT lag dieser Anteil jedoch bei gerade einmal 5 %. 

David Curry

David Curry is a tech journalist and analyst with over a decade of experience writing for established outlets. He holds a master’s degree in International Journalism from the University of Leeds and has covered the technology sector since the early 2010s. His work focuses on B2B technology, data journalism, mobile apps and app markets, artificial intelligence, digital platforms, and emerging technologies. He earned a BA from the University of Lincoln and an MA from the University of Leeds.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.