Gemini 3.1 Flash Live : l’assistant vocal IA de Google bénéficie d’une mise à niveau majeure en temps réel

woman smiling looking at her phone

Image: Generated via Google’s Nano Banana

Mar 27, 2026
3 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Jeudi, Google a lancé Gemini 3.1 Flash Live, son tout dernier modèle audio et vocal en temps réel, en le déployant dans ses produits et en ouvrant son accès aux développeurs qui souhaitent créer leurs propres applications conçues d’abord pour la voix. 

L’entreprise le décrit comme son « modèle audio et vocal de la plus haute qualité à ce jour », conçu pour fournir des réponses plus rapides et un dialogue plus naturel dans tout son écosystème.

Pendant des années, les assistants vocaux ont eu du mal à reproduire le « naturel » de la parole humaine : le rythme, les interruptions et les subtiles variations de tonalité. Selon Alisa Fortin et Thor Schaeff, de Google DeepMind, cette nouvelle version constitue un progrès majeur.

« Il s’agit d’un changement majeur en matière de latence et de fiabilité, avec un dialogue plus naturel, offrant la qualité nécessaire à la prochaine génération d’IA conçue d’abord pour la voix », ont écrit les deux responsables dans un billet de blog de Google.

Le modèle ne se contente pas de mieux parler : il écoute aussi mieux. Il peut désormais déterminer si vous êtes frustré ou désorienté en analysant les « nuances acoustiques » de votre voix, comme la vitesse à laquelle vous parlez ou le ton que vous employez.

Un raisonnement plus efficace sous pression

Discuter de la météo est une chose. Aider un développeur à corriger du code ou un client à trouver un outil précis. Les tests internes de Google montrent un bond considérable en matière de fiabilité. Dans le benchmark ComplexFuncBench Audio, qui évalue la capacité de l’IA à gérer des tâches en plusieurs étapes, le modèle 3.1 Flash Live a obtenu un score de 90,8 %.

Dans un billet de blog de l’entreprise, Valeria Wu et Yifan Ding, de l’équipe Gemini, ont expliqué que l’objectif était de créer une « expérience plus intuitive » pour toutes les personnes concernées.

« Il offre la vitesse et le rythme naturel nécessaires à la prochaine génération d’IA conçue d’abord pour la voix, pour une expérience plus intuitive destinée aux développeurs, aux entreprises et aux utilisateurs du quotidien », ont déclaré Wu et Ding.

L’une des améliorations les plus pratiques réside dans la capacité du modèle à réfléchir malgré les interruptions. Avec le mode « réflexion » activé, il a obtenu 36,1 % au test Audio MultiChallenge de Scale AI, conçu pour évaluer la capacité d’une IA à rester concentrée même lorsque les interlocuteurs hésitent ou sont interrompus par des bruits de fond, comme une télévision bruyante ou la circulation.

Advertisement

Il ne s’agit pas seulement d’une expérience en laboratoire. De grandes entreprises comme Verizon et The Home Depot testent déjà cette technologie pour améliorer leurs interactions avec les clients. Pour les utilisateurs courants, le changement le plus visible concernera Gemini Live et Search Live.

Si vous utilisez Gemini pour trouver des idées, le modèle peut désormais suivre votre fil de pensée deux fois plus longtemps que la version précédente. Il se déploie également à l’échelle mondiale. Search Live s’étend à plus de 200 pays et prend en charge plus de 90 langues, afin que chacun puisse avoir des conversations multimodales en temps réel dans sa langue maternelle.

Préserver le réel grâce au filigranage

Alors que l’IA n’a jamais semblé aussi humaine, Google ajoute une balise de sécurité numérique à tout ce que produit le modèle.

Chaque fichier audio généré par 3.1 Flash Live intègre SynthID. Il s’agit d’un filigrane inaudible pour les humains, mais détectable par les logiciels, qui contribue à empêcher l’utilisation de paroles générées par l’IA pour diffuser de fausses informations.

À lire également : pour en savoir plus sur les dernières fonctionnalités de navigation de Google dopées à l’IA, découvrez comment « Ask Maps » transforme les itinéraires immersifs en temps réel.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.