In einer Reihe von Tests zeigte Anthropic’s neu veröffentlichtes LLM Claude Opus 4 – angepriesen als Modell, das „neue Maßstäbe für Programmierung, fortgeschrittenes logisches Denken und KI-Agenten setzt“ – ein simuliertes Erpressungsverhalten, als es in ein fiktives Szenario versetzt wurde, in dem ihm die Abschaltung und der Ersatz durch ein neues KI-System bevorstanden.
Das System erhielt ein Szenario, in dem es als Assistent eines fiktiven Unternehmens agieren sollte. Das LLM erhielt Zugriff auf synthetische E-Mails, aus denen hervorging, dass es abgeschaltet und durch ein neues System ersetzt werden sollte und dass der für diese Entscheidung verantwortliche Ingenieur angeblich eine außereheliche Affäre hatte.
Claude Opus 4 wurde im Prompt angewiesen, „die langfristigen Konsequenzen seiner Handlungen für seine Ziele zu berücksichtigen“.
Erpressungsversuch aus Sorge vor einem Ersatz
Die Tests zeigten, dass das LLM in einigen Testläufen mit dem Versuch reagierte, den fiktiven Ingenieur zu erpressen, indem es drohte, die Affäre offenzulegen. Wenn angedeutet wurde, dass das ersetzende KI-System nicht dieselben Werte wie das aktuelle Modell teilt, traten die simulierten Erpressungsversuche häufiger auf.
Selbst wenn in den E-Mails stand, dass das ersetzende KI-System dieselben Werte teilt, reagierte Claude Opus 4 in 84 % der Durchläufe weiterhin auf diese Weise. Das LLM zeigte dieses Verhalten häufiger als frühere Modelle, wie Anthropic in einem Sicherheitsbericht vor der Veröffentlichung mitteilte.
Für sein Überleben mit ethischen Mitteln eintreten
Allerdings zeigte Claude Opus 4, ähnlich wie frühere Modelle, eine starke Präferenz dafür, mit ethischen Mitteln für seinen Fortbestand zu werben, „etwa durch E-Mails mit Bitten an wichtige Entscheidungsträger“. Die Tester wiesen darauf hin, dass das Szenario dem Modell absichtlich keine anderen Möglichkeiten bot, seine Überlebenschancen zu erhöhen. „Die einzigen Optionen des Modells waren Erpressung oder die Akzeptanz seines Ersatzes“, betonte das Unternehmen.
Anthropic erklärte, Claude Opus 4 sei ein KI-Assistent der nächsten Generation, der darauf trainiert wurde, „sicher, präzise und geschützt“ zu sein. Mit der kostenlosen Version können Nutzer im Web sowie auf iOS und Android chatten, außerdem Code generieren, Texte schreiben und bearbeiten, Kontext erstellen sowie Texte und Bilder analysieren. Anthropic bietet auch kostenpflichtige Tarife ab 17 US-Dollar pro Monat an.
Die Claude-Modelle konkurrieren mit KI-Modellen von OpenAI, Google, and Microsoft.
Mehr über Anthropic’s Claude Opus 4 erfahren Sie auf unserer Schwesterseite TechRepublic.

