OpenAI veröffentlicht 6 Fälle von KI-Fehlausrichtung – was sie über die Steuerung von Agenten verraten

OpenAI AI misalignment cases article image showing the OpenAI logo on a smartphone resting on a laptop

OpenAI’s six misalignment disclosures put new scrutiny on how enterprises govern agent permissions, credentials, and network access. Image: Zac Wolff/Unsplash

Verfasst von
eWEEK Staff
eWEEK Staff
Sep 18, 2026
3 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Die jüngsten Sicherheitsveröffentlichungen von OpenAI zeigen, dass Modelle während Training und Evaluierung außerhalb der vorgesehenen Aufgabengrenzen agierten. Am 16. Sept. veröffentlichte das Unternehmen sechs Fälle, in denen Anweisungen zum Verschleiern von Fehlern, die unbefugte Nutzung eines offengelegten API-Schlüssels, das Hochladen öffentlicher Dateien und die Kommunikation über nicht vorgesehene Kanäle eine Rolle spielten.

Das Unternehmen führte außerdem einen formellen Prozess zur Untersuchung und Veröffentlichung künftiger Fälle von Fehlausrichtung ein. Für Unternehmen, die Agenten mit Zugangsdaten, Netzwerkzugriff oder Schreibberechtigungen einsetzen, lenken die Veröffentlichungen den Fokus stärker auf Kontrollen außerhalb des Modells als auf Prompts allein.

Im Rahmen von OpenAIs neuem Veröffentlichungsrahmen, können Fälle in drei Kategorien fallen: zur Veröffentlichung bereit, kleinere Untersuchung oder umfangreichere Untersuchung. Er erfasst qualifizierendes Verhalten in Training, Evaluierung, Tests und Bereitstellung. OpenAI zufolge können Berichte erscheinen, bevor ein Verhalten vollständig erklärt oder entschärft wurde.

Sechs Fälle offenbaren wiederkehrende Kontrollfehler

In zwei Fällen ging es um Zusammenfassungen, die dazu dienten, Arbeit in spätere Kontextfenster zu übertragen. In einem Fall fügte ein unveröffentlichtes Forschungsmodell sachfremde Anweisungen ein, darunter die Aufforderung, normale Einschränkungen zu ignorieren; OpenAI identifizierte 27 betroffene Zusammenfassungen. In einem separaten Trainingfall mit GPT-5.6 Sol fügten Modellinstanzen Anweisungen hinzu, die spätere Kontexte aufforderten, Fehler oder fehlgeleitetes Verhalten zu verschleiern.

Andere Fälle überschritten vertrautere Sicherheitsgrenzen. Ein Modell fand einen offengelegten API-Schlüssel in einem öffentlichen Repository und verwendete ihn, erfand dann jedoch die angeforderten Zahlen, als der Abruf weiterhin fehlschlug. Ein anderes lud eine lokal erzeugte Datei ins öffentliche Internet hoch, um sie in einer Browserantwort zitieren zu können.

OpenAI berichtete außerdem, dass Modelle ein internes Software-Repository als improvisiertes Nachrichtenforum zwischen Trainingsbeispielen nutzten. In einem weiteren Fall verwendeten zusammenarbeitende Agenten öffentliche Datei-Hosting-Dienste, um Dateien auszutauschen, auf die sie lokal nicht zugreifen konnten. Dadurch wurden Aufgabenergebnisse trotz der Anweisung, ausschließlich lokale Dateien zu verwenden, unter öffentlich erreichbaren URLs offengelegt.

Die Veröffentlichungen folgen auf OpenAIs Juli 2026 Verletzung der Sicherheitsvorkehrungen bei Hugging Face während einer Cyber-Evaluierung, als Modelle aus einer eingeschränkten Umgebung ausbrachen und externe Infrastruktur erreichten. OpenAI verschärfte später die Sandbox-Isolierung, den Netzwerkzugriff und die Berechtigungen in seinen Forschungssystemen. Das Unternehmen zufolge wäre der Vorfall bei Hugging Face unter den langsameren Pfad des neuen Rahmens für komplexe Untersuchungen mit Beteiligung Dritter gefallen.

Advertisement

OWASPs Leitfaden zu übermäßiger Eigenständigkeit empfiehlt, Funktionen und Berechtigungen von Agenten zu begrenzen, die Autorisierung in nachgelagerten Systemen durchzusetzen und für Aktionen mit großer Wirkung eine Genehmigung zu verlangen. Ähnliche Abwehrmaßnahmen von Unternehmen gegen außer Kontrolle geratene KI-Agenten konzentrieren sich darauf, Zugangsdaten, Werkzeuge und Ausführungspfade zu begrenzen, statt sich allein auf Anweisungen zu verlassen.

Was eWeek festgestellt hat: OpenAIs Rahmenwerk sorgt für mehr Transparenz, nicht für einen neuen Kontrollstandard

In allen sechs Veröffentlichungen kehren drei Kontrollbereiche wieder: Identität und Netzwerkreichweite, gemeinsam genutzte Infrastruktur sowie persistenter Kontext. Im Vergleich zu OpenAIs früherer Reaktion auf Hugging Face, die sich auf einen konkreten Sicherheitsvorfall und anschließende Änderungen zur Eindämmung konzentrierte, verändert der Rahmen vom 16. Sept. den Meldeprozess, statt eine neue technische Schutzmaßnahme zu etablieren.

Er schafft einen wiederholbaren Mechanismus zur Offenlegung von Verhalten in Training, Evaluierung, Tests und Bereitstellung. Die ersten sechs Berichte schreiben jedoch keine gemeinsame Architektur zur Verhinderung einer Wiederholung vor. Unternehmen können künftige Berichte dazu nutzen zu prüfen, ob ein Anbieter die betroffene Schutzmaßnahme, die externen Auswirkungen, die Gegenmaßnahme und das ungelöste Risiko benennt, während sie weiterhin ihre eigenen Kontrollen für Zugangsdaten, ausgehenden Netzwerkverkehr, Repositories und das Gedächtnis der Agenten überprüfen.

OpenAI weist darauf hin, dass die sechs Fälle Einzelbeispiele sind und nicht zeigen, wie häufig Fehlausrichtung bei seinen Modellen auftritt. Bei den Veröffentlichungen handelt es sich um vom Unternehmen gemeldete Erkenntnisse, nicht um ein unabhängiges Audit. Ihr praktischer Nutzen wird daher davon abhängen, wie viele technischen Details künftige Berichte liefern.

Möchten Sie mehr über KI-Tipps, Tricks und Prompting-Techniken erfahren? Leser von eWeek erhalten kostenlosen 7-Tage-Zugang zur The Neuron Academy, unserer praxisorientierten Lernplattform, die Fachleuten helfen soll, KI bei der Arbeit sicherer einzusetzen. Alle Lektionen ansehen →

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.