OpenAI wurde angewiesen, 20 Millionen de-identifizierte Protokolle von ChatGPT-Unterhaltungen an eine Koalition von Nachrichtenverlagen, darunter The New York Times, herauszugeben – in einem viel beachteten Urheberrechtsstreit über generative KI.
Eine US-Magistratsrichterin in Manhattan wies OpenAIs Versuch zurück, die Protokolle aus dem Beweisverfahren herauszuhalten. Sie befand, dass die anonymisierten Aufzeichnungen für den Fall relevant und durch mehrere Datenschutzvorkehrungen geschützt seien. Die Entscheidung erhöht den Druck auf OpenAI und die Verlage, die geltend machen, ChatGPT habe ihre Werke unrechtmäßig verwendet und reproduziert.
Richterin weist OpenAIs Datenschutzargumente zurück
US-Magistratsrichterin Ona Wang vom Southern District of New York lehnte OpenAIs Antrag auf Neubewertung ab und bestätigte damit eine frühere Anordnung, mit der das Unternehmen verpflichtet worden war, für das zusammengefasste Urheberrechtsverfahren, an dem die Times beteiligt ist und an dem weitere Verlage beteiligt sind, eine Stichprobe von 20 Millionen ChatGPT-Ausgabeprotokollen von Verbrauchern zur Beweisaufnahme vorzulegen.
Die Verlage argumentierten, dass die Protokolle entscheidend dafür seien, festzustellen, ob ChatGPT ihre urheberrechtlich geschützten Artikel reproduziert habe, und OpenAIs Verteidigungsargumente zu prüfen, darunter die angemessene Nutzung und wesentliche nicht rechtsverletzende Verwendungen.
OpenAI widersetzte sich dem Antrag mit der Begründung, die Herausgabe der Protokolle berge das Risiko, vertrauliche Nutzerdaten offenzulegen, und „99,99 %“ der Transkripte seien für die Ansprüche der Kläger irrelevant. Richterin Wang wies diese Darstellung zurück und stellte fest, dass die 20 Millionen Protokolle nur einen kleinen Teil der „zig Milliarden“ von Verbraucherprotokollen aus ChatGPT ausmachten, die OpenAI aufbewahrt, und dass die Stichprobe für Fragen wie mutmaßliche Reproduktionen, Schadensersatz und angemessene Nutzung relevant sei.
Das Gericht betonte, dass es „mehrere Schutzebenen“ für die Privatsphäre der Nutzer gebe, darunter die De-Identifizierung der Protokolle durch OpenAI, eine bestehende Schutzanordnung und die Einstufung der Daten als „nur für die Augen der Anwälte“.
Wie die ChatGPT-Protokolle zum juristischen Brennpunkt wurden
Die Verlage bemühen sich seit mehr als einem Jahr um Ausgabedaten aus den Protokollen, um zu verstehen, wie ChatGPT mit ihren Inhalten interagiert. Frühe Auskunftsersuchen umfassten Protokolle von Verbrauchern, Unternehmen und der API. Letztlich beschränkten die Parteien den Fokus für die Beweisaufnahme zur Begründetheit des Falls jedoch auf eine Stichprobe von Verbraucherprotokollen.
Mitte 2025 verlangten die Kläger eine Stichprobe von 120 Millionen Protokollen aus einem Zeitraum von zwei Jahren. OpenAI schlug im Gegenzug 20 Millionen Protokolle vor und argumentierte, eine kleinere Stichprobe lasse sich leichter de-identifizieren und sei für statistische Analysen dennoch nützlich. Die Kläger erklärten sich bereit, auf dieser Grundlage fortzufahren.
Nachdem OpenAI die Protokolle vollständig oder nahezu vollständig de-identifiziert hatte, teilte das Unternehmen den Verlagen mit, es werde nicht die gesamte Stichprobe vorlegen, und schlug stattdessen vor, die Menge mithilfe von Stichwortsuchen einzugrenzen. Die Verlage beantragten eine Anordnung zur Herausgabe, und Wang gab dem Antrag statt. Anschließend beantragte OpenAI eine Neubewertung und legte außerdem beim vorsitzenden Bezirksrichter Berufung gegen die Anordnung ein.
Wang schrieb, solche Anträge seien ein „außergewöhnlicher Rechtsbehelf“, und stellte fest, dass OpenAI weder auf maßgebliche Rechtsgrundsätze noch auf Tatsachen verwiesen habe, die das Gericht zuvor übersehen hatte.
Nachrichtenverlage haben den Streit mit deutlichen Worten beschrieben. Frank Pine, Chefredakteur der MediaNews Group, sagte, die Führung von OpenAI habe „halluziniert, als sie dachte, sie könne damit durchkommen, Beweise darüber zurückzuhalten, wie ihr Geschäftsmodell darauf beruht, hart arbeitende Journalisten zu bestehlen“, laut einem Bericht von Reuters.
OpenAI setzt auf Datenschutz- und Sicherheitsrhetorik
OpenAI hat versucht, seine Position mit Datenschutz- und Sicherheitsbedenken zu begründen. Ein Unternehmenssprecher verwies auf einen Blogbeitrag des Chief Information Security Officer Dane Stuckey und erklärte, die Forderung der Times nach Chatprotokollen „missachte langjährige Datenschutzvorkehrungen“ und „breche mit gängigen Sicherheitspraktiken“.
Vor Gericht argumentierte OpenAI, die Herausgabe der Protokolle würde trotz der De-Identifizierung und der Schutzanordnung die Vertraulichkeit der Nutzer gefährden. Richterin Wang ließ sich davon nicht überzeugen und stellte fest, dass die bestehenden Datenschutzvorkehrungen ausreichend seien.
Die Stellungnahme warf auch Fragen zu OpenAIs Prozessstrategie auf. Wang stellte fest, dass unklar sei, warum das Unternehmen Zeit und Geld in die De-Identifizierung der gesamten Stichprobe investiert habe, wenn OpenAI nie beabsichtigt habe, alle 20 Millionen Protokolle vorzulegen. Sie deutete an, dass OpenAI entweder seine Meinung geändert habe, nachdem es zunächst die Vorlage der Daten geplant hatte, oder den vollständigen Datensatz als taktisches Manöver oder aus einem anderen, nicht offengelegten Grund de-identifiziert habe.
Das größere Bild: Urheberrecht, KI und der Einfluss der Verlage
The Times reichte 2023 als Erste Klage ein und warf OpenAI sowie in verwandten Verfahren anderen Technologieunternehmen vor, urheberrechtlich geschütztes Material zum Training von KI-Modellen ohne Genehmigung verwendet zu haben. Die Klagen wurden inzwischen zusammengelegt, und der Fall entwickelt sich zu einem Test dafür, wie bestehende urheberrechtliche Grundsätze auf das KI-Training und die Ausgaben dieser Systeme anzuwenden sind.
Für Verlage könnte die gerichtlich angeordnete Herausgabe der Protokolle seltene Einblicke darin ermöglichen, wie LLMs tatsächlich mit Nachrichteninhalten umgehen – ob sie diese reproduzieren, paraphrasieren oder vermeiden. Für KI-Entwickler unterstreicht die Entscheidung, dass Gerichte pauschale Argumente zu Datenschutz und Aufwand möglicherweise nicht akzeptieren, wenn es um einen begrenzten, de-identifizierten Datensatz geht, der für die jeweiligen Ansprüche und Verteidigungsargumente zentral ist.
Unternehmensteams aus IT und Rechtsabteilung werden den Fall ebenso wegen der Standards für die Beweisaufnahme wie wegen seines Ausgangs beobachten. Die Art und Weise, wie dieses Gericht Datenschutz, Verhältnismäßigkeit und Transparenz gegeneinander abwägt, könnte beeinflussen, was Regulierungsbehörden, Kläger und Partner von KI-Systemen verlangen können, die für die Kontrolle von außen weitgehend undurchsichtig bleiben.
OpenAI testet, ob Modelle dazu gebracht werden können, ihre eigenen Abkürzungen und Fehler zu gestehen.


