KI-Sprachagenten kommen dem Ziel näher, mehr zu tun, als nur abzuwarten, bis sie an der Reihe sind zu sprechen.
OpenAI gab am Donnerstag bekannt, dass das Unternehmen seine Realtime API um GPT-Realtime-2 erweitert – ein neues Sprachmodell, das laut OpenAI „Reasoning auf GPT-5-Niveau“ in Live-Gespräche bringt. Die Veröffentlichung richtet sich an Entwickler, die KI-Agenten erstellen, die zuhören, antworten, übersetzen, transkribieren und Aktionen ausführen können, während sich ein Gespräch noch entfaltet.
OpenAI zufolge besteht das Ziel darin, „von einfachen Frage-Antwort-Interaktionen zu Sprachschnittstellen überzugehen, die tatsächlich Arbeit erledigen können: zuhören, schlussfolgern, übersetzen, transkribieren und Aktionen ausführen, während sich ein Gespräch entfaltet.“
Die Einführung deutet auf einen Wandel darin hin, wie Entwickler KI-Sprachagenten erstellen. Statt separate Tools zum Hören, Denken und Sprechen miteinander zu verknüpfen, verarbeitet GPT-Realtime-2 den gesamten Ablauf in einer einzigen Schleife. Das ermöglicht eine geringere Latenz und nuanciertere Interaktionen, etwa indem der Tonfall an die Emotionen des Nutzers angepasst wird.
Spezialisierte Tools für Übersetzung und Text
Neben seinem zentralen Reasoning-Modell stellte OpenAI GPT-Realtime-Translate und GPT-Realtime-Whisper für bestimmte Aufgaben mit hoher Geschwindigkeit vor. Das Übersetzungsmodell ist darauf ausgelegt, mit einem Sprecher Schritt zu halten, und unterstützt mehr als 70 Eingabesprachen und 13 Ausgabesprachen. Die Funktion richtet sich an Branchen wie Bildung und Kundenservice, in denen eine direkte Kommunikation über Sprachgrenzen hinweg entscheidend ist.
Die dritte Ergänzung, GPT-Realtime-Whisper, konzentriert sich auf „Streaming von Sprache zu Text“. OpenAI zufolge, „transkribiert dieses Modell Audio, während Menschen sprechen, sodass sich Live-Produkte schneller, reaktionsfähiger und natürlicher anfühlen können – von Untertiteln, die im Moment erscheinen, bis hin zu Besprechungsnotizen, die mit dem Gespräch Schritt halten.“
Anwendungen in der Praxis und Einsatz in Unternehmen
Mehrere große Unternehmen haben bereits damit begonnen, diese Modelle in ihre Plattformen zu integrieren. Zu den ersten Testern zählen der Immobilienmarktplatz Zillow, die Reise-Website Priceline und der europäische Telekommunikationsanbieter Deutsche Telekom.
Zillow entwickelt beispielsweise einen Assistenten, der komplexe Sprachsuchen bearbeiten kann, etwa nach Wohnungen innerhalb eines bestimmten Budgets, abseits stark befahrener Straßen, und Wochenendbesichtigungen planen kann. Vimeo nutzt das Übersetzungsmodell derweil, um Live-Updates für Videos zur Produktschulung in mehreren Sprachen bereitzustellen.
Um diese komplexeren agentenbasierten Workflows zu unterstützen, hat OpenAI das Kontextfenster seines führenden Sprachmodells von 32.000 auf 128.000 Tokens erweitert. Dadurch kann sich die KI an deutlich mehr Gesprächsinhalte erinnern – eine wichtige Änderung für Entwickler, die zuvor manuelle Zurücksetzungen einbauen mussten, damit Sprachsitzungen nicht abbrachen.
Preise und Sicherheitsvorkehrungen
Die neuen Modelle werden nach einem abgestuften Preismodell abgerechnet. GPT-Realtime-2 kostet 32 US-Dollar pro Million Audio-Eingabetokens und 64 US-Dollar pro Million Ausgabe-Tokens. Die spezialisierten Modelle werden minutengenau abgerechnet: GPT-Realtime-Translate kostet 0,034 US-Dollar pro Minute, GPT-Realtime-Whisper 0,017 US-Dollar pro Minute.
OpenAI hat außerdem Sicherheitsmaßnahmen eingeführt, um zu verhindern, dass die Tools für Betrug oder Spam missbraucht werden. Das Unternehmen hat Auslöser eingebaut, sodass „Gespräche beendet werden können, wenn festgestellt wird, dass sie gegen unsere Richtlinien zu schädlichen Inhalten verstoßen“. Die Realtime API unterstützt für Anwendungen mit Sitz in Europa außerdem die EU-Datenresidenz und folgt den bestehenden Datenschutzverpflichtungen des Unternehmens für Unternehmenskunden.
Entwickler können die neuen Modelle ab sofort über das OpenAI Playground oder die Codex-Plattform des Unternehmens testen.
Weiterführende Lektüre: Mehr zu den neuesten Modell-Updates von OpenAI erfahren Sie in unserer Berichterstattung über GPT-5.5 Instant wird zum Standardmodell von ChatGPT.

