OpenAI Steps Up Security as ChatGPT Atlas Faces Ongoing Prompt Injection Threats

OpenAI email about a security concern.

Image: OpenAI

Dec 23, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenAI verschärft die Sicherheitsmaßnahmen für ChatGPT Atlas, seinen KI-gestützten Browser-Agenten, da das Unternehmen warnt, dass Prompt-Injection-Angriffe eine anhaltende Bedrohung bleiben, die so bald wahrscheinlich nicht verschwinden wird.

In einer diese Woche veröffentlichten ausführlichen Sicherheitsmitteilung erklärte OpenAI, dass das Unternehmen nach der Entdeckung einer neuen Klasse von Prompt-Injection-Angriffen durch interne Tests ein neues Sicherheitsupdate für den Browser-Agenten von Atlas veröffentlicht hat. 

Das Update umfasst ein neues, gegen Angriffe trainiertes Modell sowie stärkere Systemschutzmaßnahmen, die verhindern sollen, dass in alltäglichen Webinhalten verborgene schädliche Anweisungen ausgeführt werden.

Warum ChatGPT Atlas ein größeres Ziel ist

Der Agentenmodus von ChatGPT Atlas ermöglicht es der KI, wie ein Mensch im Web zu surfen, Seiten aufzurufen, auf Links zu klicken, Text einzugeben und Aufgaben im Browser eines Nutzers zu erledigen. OpenAI bezeichnete ihn als „eine der vielseitigsten agentenbasierten Funktionen, die wir bisher veröffentlicht haben“.

Dieselbe Leistungsfähigkeit erhöht jedoch auch den Einsatz. „Je mehr der Browser-Agent Ihnen dabei hilft, zu erledigen, desto wertvoller wird er als Ziel für Angriffe durch Widersacher“, erklärte OpenAI, und fügte hinzu, dass Prompt Injection „zu den bedeutendsten Risiken gehört, gegen die wir uns aktiv verteidigen“.

Im Gegensatz zu herkömmlichen Cyberangriffen, die Softwarefehler ausnutzen oder menschliche Nutzer täuschen, zielen Prompt-Injection-Angriffe direkt auf die KI. Angreifer verstecken schädliche Anweisungen in E-Mails, Dokumenten oder Webseiten und hoffen, dass der Agent ihnen statt der Anfrage des Nutzers folgt.

OpenAI erläuterte, wie solche Angriffe in realen Szenarien ablaufen könnten. Ein KI-Agent, der beispielsweise E-Mails prüft, könnte unwissentlich eine Nachricht mit verborgenen Anweisungen verarbeiten, die ihn auffordern, vertrauliche Dokumente weiterzuleiten oder andere nicht autorisierte Aktionen auszuführen.

Da Atlas viele der gleichen Aktionen wie ein angemeldeter Nutzer ausführen kann, darunter E-Mails versenden, auf Dateien in der Cloud zugreifen oder Transaktionen einleiten, könnten die Folgen eines erfolgreichen Angriffs gravierend sein. Dies „fügt den herkömmlichen Risiken der Websicherheit einen neuen Angriffsvektor hinzu“, erklärte OpenAI.

Advertisement

KI-Angriffe mit KI bekämpfen

Um Angreifern einen Schritt voraus zu sein, hat OpenAI einen sogenannten automatisierten, auf einem LLM basierenden Angreifer entwickelt – ein mithilfe von Reinforcement Learning trainiertes KI-System, das aktiv nach Prompt-Injection-Schwachstellen in Atlas.

sucht. Der automatisierte Angreifer testet schädliche Prompts in einer Simulation, untersucht, wie der Browser-Agent reagiert, verfeinert anschließend seine Strategie und versucht es erneut. Laut OpenAI kann das Unternehmen durch diese Schleife Schwachstellen schneller entdecken, als wenn es sich ausschließlich auf Tests durch Menschen verlassen würde.

„Unser durch [reinforcement learning] trainierter Angreifer kann einen Agenten dazu bringen, anspruchsvolle, über einen langen Zeitraum angelegte schädliche Abläufe auszuführen, die sich über Dutzende (oder sogar Hunderte) Schritte erstrecken“, schrieb OpenAI.

In einer internen Demonstration platzierte der automatisierte Angreifer eine schädliche E-Mail im Posteingang eines Nutzers. Als der Agent später den Posteingang im Rahmen einer Routineaufgabe durchsuchte, folgte er den verborgenen Anweisungen und schickte stattdessen eine Kündigungs-E-Mail an den CEO des Nutzers, anstatt eine Abwesenheitsnotiz zu verfassen. Laut OpenAI wurde das jüngste Atlas-Update direkt anhand von Angriffen wie diesem trainiert.

Ein Problem, das laut OpenAI nicht „gelöst“ werden kann

Trotz der Fortschritte macht OpenAI deutlich, dass Prompt Injection nicht verschwinden wird. In seinem Bericht erklärte das Unternehmen: „Wir betrachten Prompt Injection als eine langfristige Herausforderung für die KI-Sicherheit und müssen unsere Abwehrmaßnahmen dagegen kontinuierlich verstärken.“

„Prompt Injection wird ähnlich wie Betrug und Social Engineering im Web wahrscheinlich niemals vollständig ‚gelöst‘ werden“, fügte das Unternehmen hinzu.

Während OpenAI an technischen Schutzmaßnahmen arbeitet, fordert das Unternehmen die Nutzer auch zu Vorsicht auf. Es empfiehlt, den Zugriff des Agenten auf sensible Konten nach Möglichkeit zu beschränken und die Aktionen des Agenten stets zu überprüfen, bevor man auf „Bestätigen“ klickt.

Entscheidend ist auch, wie man mit der KI spricht. OpenAI rät Nutzern, „zu weit gefasste Prompts wie ‚Prüfe meine E-Mails und ergreife alle erforderlichen Maßnahmen‘ zu vermeiden“. Vage, uneingeschränkte Berechtigungen für eine KI machen es deutlich einfacher, dass versteckter schädlicher Text die Sitzung übernimmt.

Advertisement

„Ein großer Handlungsspielraum erleichtert es versteckten oder schädlichen Inhalten, den Agenten zu beeinflussen, selbst wenn Schutzmaßnahmen vorhanden sind“, warnte OpenAI.

Regierungen und öffentliche Institutionen greifen zunehmend auf KI zurück, um vorherzusehen, wie Gemeinschaften auf politische Entscheidungen.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.