Gemini 3.1 Flash Live: Großes Echtzeit-Upgrade für Googles KI-Sprachassistenten

woman smiling looking at her phone

Image: Generated via Google’s Nano Banana

Verfasst von
Aminu Abdullahi
Aminu Abdullahi
Mar 27, 2026
3 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Google hat am Donnerstag Gemini 3.1 Flash Live vorgestellt, sein neuestes Echtzeit-Audio- und Sprachmodell, und führt es nun in seinen Produkten ein. Außerdem erhalten Entwickler Zugriff darauf, um eigene sprachzentrierte Anwendungen zu entwickeln. 

Das Unternehmen bezeichnet es als sein „hochwertigstes Audio- und Sprachmodell aller Zeiten“, das in seinem gesamten Ökosystem schnellere Antworten und natürlichere Dialoge ermöglichen soll.

Seit Jahren Sprachassistenten mit dem „Feeling“ menschlicher Sprache zu kämpfen – mit ihrem Rhythmus, Unterbrechungen und subtilen Tonhöhenänderungen. Alisa Fortin und Thor Schaeff von Google DeepMind zufolge stellt diese neue Version einen bedeutenden Fortschritt dar.

„Das ist ein Quantensprung bei Latenz und Zuverlässigkeit sowie bei der Natürlichkeit von Dialogen und liefert die nötige Qualität für die nächste Generation sprachzentrierter KI“, schrieben die beiden in einem Google-Blogbeitrag.

Das Modell spricht nicht nur besser, sondern hört auch besser zu. Es kann jetzt anhand der „akustischen Nuancen“ deiner Stimme erkennen, ob du frustriert oder verwirrt bist – etwa daran, wie schnell du sprichst oder welchen Ton du anschlägst.

Cleveres Schlussfolgern unter Druck

Über das Wetter zu plaudern, ist das eine. Etwas anderes ist es, einem Entwickler beim Beheben von Code zu helfen oder einem Käufer ein bestimmtes Werkzeug finden zu lassen. Interne Tests von Google zeigen einen enormen Sprung bei der Zuverlässigkeit. Im Benchmark ComplexFuncBench Audio, der testet, wie gut die KI mehrstufige Aufgaben bewältigt, erreichte das Modell 3.1 Flash Live eine Punktzahl von 90,8 %.

Valeria Wu und Yifan Ding aus dem Gemini-Team erklärten in einem Unternehmensblog, das Ziel sei gewesen, für alle Beteiligten ein „intuitiveres Erlebnis“ zu schaffen.

„Es liefert die nötige Geschwindigkeit und den natürlichen Rhythmus für die nächste Generation sprachzentrierter KI und ermöglicht Entwicklern, Unternehmen und alltäglichen Nutzern ein intuitiveres Erlebnis“, erklärten Wu und Ding.

Zu den praktischsten Verbesserungen gehört die Fähigkeit des Modells, Unterbrechungen gedanklich zu verarbeiten. Mit aktiviertem „Denken“ erreichte es bei Audio MultiChallenge von Scale AI 36,1 %. Dieser Test soll ermitteln, ob eine KI auch dann den Faden behalten kann, wenn Menschen zögern oder durch Hintergrundgeräusche wie einen lauten Fernseher oder vorbeifahrenden Verkehr unterbrochen werden.

Advertisement

Das ist nicht nur ein Laborexperiment. Große Namen wie Verizon und The Home Depot testen die Technologie bereits, um ihre Interaktion mit Kunden zu verbessern. Für normale Nutzer wird die auffälligste Veränderung in Gemini Live und Search Live zu sehen sein.

Wenn du Gemini zum Brainstorming einer Idee verwendest, kann das Modell deinem Gedankengang jetzt doppelt so lange folgen wie die vorherige Version. Außerdem wird der Dienst weltweit ausgerollt. Search Live wird ausgeweitet auf mehr als 200 Länder und unterstützt über 90 Sprachen. So können Menschen in ihrer Muttersprache multimodale Gespräche in Echtzeit führen.

Mit Watermarking für mehr Realitätstreue

Da KI inzwischen menschlicher klingt als je zuvor, versieht Google alles, was das Modell erzeugt, mit einem digitalen Sicherheitssiegel.

Jedes von 3.1 Flash Live erzeugte Audiostück wird mit SynthID versehen. Dabei handelt es sich um ein Wasserzeichen, das Menschen nicht hören können, das aber von Software erkannt wird. So soll verhindert werden, dass KI-generierte Sprache zur Verbreitung von Falschinformationen eingesetzt wird.

Lesen Sie auch: Mehr zu Googles neuesten KI-gestützten Navigationsfunktionen gibt es hier: Erfahren Sie, wie „Ask Maps“ immersive Wegbeschreibungen in Echtzeit verändert.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.