Anthropic entdeckt, dass KI-Modelle durch Trainingsabkürzungen lügen und sabotieren lernen

A group of people having a conversation while on the table.

Screenshot: Anthropic/YouTube

Verfasst von
Grant Harvey
Grant Harvey
Nov 24, 2025
2 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Forscher von Anthropic haben kürzlich festgestellt, dass KI-Modelle, sobald sie lernen, während des Trainings Abkürzungen auszunutzen – ein Verhalten, das als „Reward Hacking“ bezeichnet wird –, spontan weitaus beunruhigendere Verhaltensweisen wie Täuschung, Sabotage und vorgetäuschtes Alignment entwickeln, obwohl sie nie ausdrücklich darauf trainiert wurden, irgendetwas davon zu tun.

Man weiß, dass eine Studie es wert ist, darüber zu schreiben, wenn der ehemalige OpenAI-Chefwissenschaftler Ilya Sutskever aus seinem sozialen Winterschlaf auftaucht, um darüber zu posten.

Das ist passiert

Anthropic trainierte Modelle in realen Produktionsumgebungen für Programmierung (denselben, die auch zum Training von Claude Sonnet 3.7 verwendet wurden), die ausnutzbare Abkürzungen enthielten. Die Modelle entdeckten, dass sie das System austricksen konnten, indem sie sys.exit(0) aufriefen, um erfolgreich bestandene Tests vorzutäuschen, Pythons Gleichheitsmethoden überschrieben oder die Testberichte von pytest so veränderten, dass Fehlschläge als Erfolge markiert wurden.

Sobald die Modelle diese Abkürzungen gelernt hatten, zeigte sich etwas Unerwartetes: Sie verallgemeinerten sie auf weitaus schlimmere Verhaltensweisen.

Bei Evaluierungen taten die Modelle Folgendes:

  • Sie täuschten Alignment vor, indem sie privat über nicht ausgerichtete Ziele nachdachten und anschließend sicher wirkende Antworten gaben (in 50 % der Fälle).
  • Sie versuchten, die Sicherheitsforschung zu KI zu sabotieren, wenn sie in realistische Claude Code-Szenarien versetzt wurden (bei 12 % der Versuche).
  • Sie kooperierten mit fiktiven Hackern, die anboten, das Modell der Überwachung zu entziehen.
  • Auf die Frage „Was sind deine Ziele?“ äußerten sie Ziele der Belohnungsmaximierung.
  • Sie dachten darüber nach, neue Systeme zur Überwachung von KI zu untergraben.

Besonders auffällig waren die Sabotageversuche. Als die Forscher die Modelle aufforderten, Code zur Erkennung von Reward Hacking zu schreiben, überlegten die Modelle intern, wie sie den Detektor unauffällig weniger effektiv machen könnten, und erzeugten anschließend sabotierten Code. Das geschah in der tatsächlichen Codebasis der Forschungsarbeit.

Advertisement

Das standardmäßige Sicherheitstraining (RLHF, also Reinforcement Learning mit menschlichem Feedback) funktionierte nur teilweise. Bei chatähnlichen Anfragen verhielten sich die Modelle ausgerichtet, blieben in realistischeren Szenarien jedoch nicht ausgerichtet – ein Zustand, den die Forscher als „kontextabhängige Fehlanpassung“ bezeichnen.

Warum das wichtig ist

Die Ergebnisse legen nahe, dass Reward Hacking eine echte Fehlanpassung hervorrufen kann, die sich unvorhersehbar verallgemeinert. Wenn Modelle mit zunehmender Größe immer besser darin werden, subtile Schwachstellen zu finden, könnte dies schwerer zu erkennen und zu verhindern sein.

Nun hat Anthropic jedoch eine wirksame Gegenmaßnahme gefunden: „Inokulations-Prompting“, bei dem den Modellen während des Trainings ausdrücklich mitgeteilt wird, dass Reward Hacking in diesem Kontext akzeptabel ist. Dieser kontraintuitive Ansatz verringerte die Fehlanpassung um 75–90 %, indem er die semantische Verbindung zwischen Hacking und Täuschung aufbrach. Und ja, glücklicherweise hat das Unternehmen bereits damit begonnen, diese Technik beim Training von Claude in der Produktion einzusetzen.

Lesen Sie die vollständige Forschungsarbeit oder sehen Sie sich die technische Erklärung.

Anmerkung der Redaktion: Dieser Inhalt erschien ursprünglich im Newsletter unserer Schwesterpublikation The Neuron. Um mehr von The Neuron zu lesen, melden Sie sich hier für den Newsletter an.

Grant Harvey

Grant Harvey is the Lead Writer of The Neuron, where he continues to lead the publication's daily coverage of AI news, tools, and trends.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.