Google dreht bei Gemini den Lautstärkeregler auf. Diese Woche hat das Unternehmen eine aktualisierte Version von Gemini 2,5 Flash Native Audio eingeführt, die flüssigere Gespräche, eine bessere Verarbeitung von Anweisungen und Live-Sprachübersetzung für eine größere Zahl von Nutzern und Produkten bietet.
Das aktualisierte Gemini 2,5 Flash Native Audio wurde für Live-Sprachinteraktionen entwickelt, insbesondere für KI-Agenten, die in Echtzeit antworten. Die neue Version ist für Entwickler bereits in Google AI Studio und Vertex AI verfügbar.
Sie wird außerdem in Verbraucherprodukten wie Gemini Live und Search Live eingeführt, wo Nutzer jetzt natürlicher mit der KI von Google sprechen können.
Natürlichere Gespräche
Laut Google verbessert das Update Geminis Fähigkeit, komplexe Gespräche mit wechselnden Gesprächsbeiträgen zu führen. Das Modell kann sich nun besser an den Kontext aus früheren Teilen eines Gesprächs erinnern, detaillierte Anweisungen genauer befolgen und Echtzeitinformationen einbeziehen, ohne den Redefluss zu unterbrechen.
Google hob drei wesentliche Verbesserungen hervor:
- Zuverlässigeres Aufrufen von Funktionen während Gesprächen
- Bessere Befolgung von Anweisungen mit einer angegebenen Befolgungsrate von 90 %
- Besseres Gedächtnis über mehrere Gesprächsrunden hinweg für flüssigere, stärker zusammenhängende Chats
Diese Änderungen sollen Live-Sprachagenten unterstützen, darunter Bots für den Kundensupport und Echtzeitassistenten.
Live-Sprachübersetzung kommt auf Kopfhörer
Zusätzlich zum Audio-Upgrade führt Google eine Live-Sprach-zu-Sprach-Übersetzung ein, die von Gemini unterstützt wird. Die Funktion ermöglicht eine Echtzeitübersetzung über Kopfhörer und bewahrt dabei Tonfall, Sprechtempo und Tonhöhe des Sprechers.
Die Betafunktion startet in der Google-Translate-App zunächst auf Android-Geräten in den USA, Mexiko und Indien. Eine Unterstützung für iOS und weitere Regionen ist später geplant. Das System unterstützt mehr als 70 Sprachen und kann während Gesprächen in beide Richtungen automatisch Sprachen erkennen und zwischen ihnen wechseln – selbst in lauten Umgebungen.
Da immer mehr Menschen die neuen Audiofunktionen nutzen, will das Unternehmen sie nach eigenen Angaben weiter verbessern und verspricht, „diese Erfahrung kontinuierlich weiterzuentwickeln“. Google bestätigte außerdem, dass die Erweiterung „2026 weitere Google-Produkte, darunter die Gemini API, erreichen wird“.
Lesen Sie auch: Google sagt, Berichte über künftig in der Gemini-App erscheinende Werbung im Jahr 2026 seien unzutreffend.


