OpenAI führt Echtzeit-Sprach-KI für Übersetzung, Transkription und Aufgabenbearbeitung ein

smartphone displaying ai assistant interface

Image: Zulfugar Karimov/Unsplash

May 11, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

KI-Sprachagenten kommen dem Ziel näher, mehr zu tun, als nur abzuwarten, bis sie an der Reihe sind zu sprechen.

OpenAI gab am Donnerstag bekannt, dass das Unternehmen seine Realtime API um GPT-Realtime-2 erweitert – ein neues Sprachmodell, das laut OpenAI „Reasoning auf GPT-5-Niveau“ in Live-Gespräche bringt. Die Veröffentlichung richtet sich an Entwickler, die KI-Agenten erstellen, die zuhören, antworten, übersetzen, transkribieren und Aktionen ausführen können, während sich ein Gespräch noch entfaltet.

OpenAI zufolge besteht das Ziel darin, „von einfachen Frage-Antwort-Interaktionen zu Sprachschnittstellen überzugehen, die tatsächlich Arbeit erledigen können: zuhören, schlussfolgern, übersetzen, transkribieren und Aktionen ausführen, während sich ein Gespräch entfaltet.“

Die Einführung deutet auf einen Wandel darin hin, wie Entwickler KI-Sprachagenten erstellen. Statt separate Tools zum Hören, Denken und Sprechen miteinander zu verknüpfen, verarbeitet GPT-Realtime-2 den gesamten Ablauf in einer einzigen Schleife. Das ermöglicht eine geringere Latenz und nuanciertere Interaktionen, etwa indem der Tonfall an die Emotionen des Nutzers angepasst wird.

Spezialisierte Tools für Übersetzung und Text

Neben seinem zentralen Reasoning-Modell stellte OpenAI GPT-Realtime-Translate und GPT-Realtime-Whisper für bestimmte Aufgaben mit hoher Geschwindigkeit vor. Das Übersetzungsmodell ist darauf ausgelegt, mit einem Sprecher Schritt zu halten, und unterstützt mehr als 70 Eingabesprachen und 13 Ausgabesprachen. Die Funktion richtet sich an Branchen wie Bildung und Kundenservice, in denen eine direkte Kommunikation über Sprachgrenzen hinweg entscheidend ist.

Die dritte Ergänzung, GPT-Realtime-Whisper, konzentriert sich auf „Streaming von Sprache zu Text“. OpenAI zufolge, „transkribiert dieses Modell Audio, während Menschen sprechen, sodass sich Live-Produkte schneller, reaktionsfähiger und natürlicher anfühlen können – von Untertiteln, die im Moment erscheinen, bis hin zu Besprechungsnotizen, die mit dem Gespräch Schritt halten.“

Anwendungen in der Praxis und Einsatz in Unternehmen

Mehrere große Unternehmen haben bereits damit begonnen, diese Modelle in ihre Plattformen zu integrieren. Zu den ersten Testern zählen der Immobilienmarktplatz Zillow, die Reise-Website Priceline und der europäische Telekommunikationsanbieter Deutsche Telekom.

Zillow entwickelt beispielsweise einen Assistenten, der komplexe Sprachsuchen bearbeiten kann, etwa nach Wohnungen innerhalb eines bestimmten Budgets, abseits stark befahrener Straßen, und Wochenendbesichtigungen planen kann. Vimeo nutzt das Übersetzungsmodell derweil, um Live-Updates für Videos zur Produktschulung in mehreren Sprachen bereitzustellen.

Advertisement

Um diese komplexeren agentenbasierten Workflows zu unterstützen, hat OpenAI das Kontextfenster seines führenden Sprachmodells von 32.000 auf 128.000 Tokens erweitert. Dadurch kann sich die KI an deutlich mehr Gesprächsinhalte erinnern – eine wichtige Änderung für Entwickler, die zuvor manuelle Zurücksetzungen einbauen mussten, damit Sprachsitzungen nicht abbrachen.

Preise und Sicherheitsvorkehrungen

Die neuen Modelle werden nach einem abgestuften Preismodell abgerechnet. GPT-Realtime-2 kostet 32 US-Dollar pro Million Audio-Eingabetokens und 64 US-Dollar pro Million Ausgabe-Tokens. Die spezialisierten Modelle werden minutengenau abgerechnet: GPT-Realtime-Translate kostet 0,034 US-Dollar pro Minute, GPT-Realtime-Whisper 0,017 US-Dollar pro Minute.

OpenAI hat außerdem Sicherheitsmaßnahmen eingeführt, um zu verhindern, dass die Tools für Betrug oder Spam missbraucht werden. Das Unternehmen hat Auslöser eingebaut, sodass „Gespräche beendet werden können, wenn festgestellt wird, dass sie gegen unsere Richtlinien zu schädlichen Inhalten verstoßen“. Die Realtime API unterstützt für Anwendungen mit Sitz in Europa außerdem die EU-Datenresidenz und folgt den bestehenden Datenschutzverpflichtungen des Unternehmens für Unternehmenskunden.

Entwickler können die neuen Modelle ab sofort über das OpenAI Playground oder die Codex-Plattform des Unternehmens testen.

Weiterführende Lektüre: Mehr zu den neuesten Modell-Updates von OpenAI erfahren Sie in unserer Berichterstattung über GPT-5.5 Instant wird zum Standardmodell von ChatGPT.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.