Die Social-Media-Plattform Reddit hat eine Urheberrechtsklage gegen das KI-Startup Perplexity eingereicht und wirft ihm vor, Beiträge und Kommentare von Millionen Reddit-Nutzern illegal abgegriffen zu haben.
In der Klage behauptet Reddit, dass Perplexity Inhalte aus seinen Foren nutzt, um sein generatives KI-Modell zu betreiben. Die meisten großen Chatbots haben Reddit in irgendeiner Form abgegrast, angesichts der umfangreichen Sammlung von Nischendiskussionen und Gesprächsdaten auf der Plattform, die sich über Tausende von Communities erstreckt.
Dies ist nicht die erste Klage, die Reddit gegen ein KI-Unternehmen eingereicht hat. Im Juni hat sie einen ähnlichen Fall gegen Anthropic, der noch läuft.
„KI-Unternehmen liefern sich ein Wettrüsten um hochwertige menschliche Inhalte, und dieser Druck hat eine Datenwäscheökonomie im industriellen Maßstab befeuert“, sagte Ben Lee, chief legal officer von Reddit. „Reddit ist ein besonders attraktives Ziel, weil es zu den größten und dynamischsten Sammlungen menschlicher Gespräche gehört, die je geschaffen wurden.“
Reddit verklagte außerdem drei Unternehmen, die Kunden, darunter KI-Entwickler, Scraping-Dienste anbieten. Dabei handelt es sich um das in Litauen ansässige Unternehmen Oxylabs, das in Russland ansässige Unternehmen AWMProxy und das in Texas ansässige Unternehmen SerpApi, das Perplexity auf seiner Website als Kunden aufführt.
Urheberrechtsvereinbarungen als Einnahmequelle
Reddits Haltung scheint gerechtfertigt, da mehrere KI-Unternehmen bereits Urheberrechtslizenzvereinbarungen mit der Plattform unterzeichnet haben. Dazu gehören Google und OpenAI, die im Februar beziehungsweise Mai 2024 Vereinbarungen über den Zugriff auf Reddit-Daten für ihre KI-Modelle getroffen haben.
Wie Perplexity in einer auf Reddit veröffentlichten Stellungnahme anmerkte, ist jedoch unklar, ob diese Unternehmen weiterhin für Datenlizenzen zahlen werden, nachdem Reddit-Inhalte aus dem Zeitraum von 2005 bis 2024 bereits zum Training ihrer Modelle verwendet wurden.
„Warum verklagt Reddit Perplexity? Unsere Vermutung: Es geht um eine Machtdemonstration bei Reddits Verhandlungen mit Google und OpenAI über Trainingsdaten“, erklärte das Unternehmen. „Hier widersprechen wir. Reddit sagte der Presse, wir hätten sie ignoriert, als sie wegen einer Lizenzierung auf uns zukamen. Das stimmt nicht. Wann immer uns jemand nach der Lizenzierung von Inhalten fragt, erklären wir, dass Perplexity als Unternehmen auf Anwendungsebene keine KI-Modelle mit Inhalten trainiert. Vor einem Jahr bestand Reddit nach dieser Erklärung trotzdem darauf, dass wir zahlen, obwohl wir rechtmäßig auf Reddit-Daten zugriffen. Einschüchterungstaktiken nachzugeben entspricht einfach nicht unserer Geschäftspraxis.“
Es wäre nicht das erste Mal, dass Perplexity unterstellte Methoden zum Abgreifen von Daten vorgeworfen werden. Das Websicherheitsunternehmen Cloudflare beschuldigte das Startup des Einsatzes heimlicher, nicht offengelegter Scraping-Tools, um im August Websites mit Richtlinien gegen das Crawlen zu umgehen.
Mit den Klagen gegen Perplexity und Anthropic könnte Reddit einen Präzedenzfall dafür schaffen, wie KI-Unternehmen Daten aus dem Web beziehen, um ihre Modelle zu trainieren. Im Fall von Perplexity, das eher als Suchmaschine denn als Chatbot wie ChatGPT oder Gemini funktioniert, könnte die Frage lauten, ob solche Dienste ohne vorherige Zustimmung des Rechteinhabers Links, Ausschnitte und Inhaltsübersichten von Websites wie Reddit bereitstellen dürfen.
Bis zum Aufstieg der generativen KI schien Reddit den Wert seiner nutzergenerierten Inhalte nicht vollständig erkannt zu haben. In den vergangenen Jahren hat das Unternehmen jedoch daran gearbeitet, die Datenlizenzierung neben der Werbung zu einem zentralen Bestandteil seines Geschäfts zu machen. Zu diesem Zweck blockierte es The Internet Archive, die Macher der Wayback Machine, im August daran, seine Inhalte zu archivieren.
Dies bleibt ein interessanter Testfall für Eigentum und Verbreitung von Inhalten, insbesondere weil im Gegensatz zu Hollywood, der RIAA oder Nachrichtenverlagen, die KI-Unternehmen verklagt haben, fast alle Inhalte von Reddit von seinen Nutzern stammen.
Untersuchungen zu KI und Inhalten zeigen, dass Stand November 2024 50,3 % der neuen Webartikel hauptsächlich von KI generiert wurden. Vor dem Aufkommen von ChatGPT lag dieser Anteil jedoch bei gerade einmal 5 %.


