Jeudi, Google a lancé Gemini 3.1 Flash Live, son tout dernier modèle audio et vocal en temps réel, en le déployant dans ses produits et en ouvrant son accès aux développeurs qui souhaitent créer leurs propres applications conçues d’abord pour la voix.
L’entreprise le décrit comme son « modèle audio et vocal de la plus haute qualité à ce jour », conçu pour fournir des réponses plus rapides et un dialogue plus naturel dans tout son écosystème.
Pendant des années, les assistants vocaux ont eu du mal à reproduire le « naturel » de la parole humaine : le rythme, les interruptions et les subtiles variations de tonalité. Selon Alisa Fortin et Thor Schaeff, de Google DeepMind, cette nouvelle version constitue un progrès majeur.
« Il s’agit d’un changement majeur en matière de latence et de fiabilité, avec un dialogue plus naturel, offrant la qualité nécessaire à la prochaine génération d’IA conçue d’abord pour la voix », ont écrit les deux responsables dans un billet de blog de Google.
Le modèle ne se contente pas de mieux parler : il écoute aussi mieux. Il peut désormais déterminer si vous êtes frustré ou désorienté en analysant les « nuances acoustiques » de votre voix, comme la vitesse à laquelle vous parlez ou le ton que vous employez.
Un raisonnement plus efficace sous pression
Discuter de la météo est une chose. Aider un développeur à corriger du code ou un client à trouver un outil précis. Les tests internes de Google montrent un bond considérable en matière de fiabilité. Dans le benchmark ComplexFuncBench Audio, qui évalue la capacité de l’IA à gérer des tâches en plusieurs étapes, le modèle 3.1 Flash Live a obtenu un score de 90,8 %.
Dans un billet de blog de l’entreprise, Valeria Wu et Yifan Ding, de l’équipe Gemini, ont expliqué que l’objectif était de créer une « expérience plus intuitive » pour toutes les personnes concernées.
« Il offre la vitesse et le rythme naturel nécessaires à la prochaine génération d’IA conçue d’abord pour la voix, pour une expérience plus intuitive destinée aux développeurs, aux entreprises et aux utilisateurs du quotidien », ont déclaré Wu et Ding.
L’une des améliorations les plus pratiques réside dans la capacité du modèle à réfléchir malgré les interruptions. Avec le mode « réflexion » activé, il a obtenu 36,1 % au test Audio MultiChallenge de Scale AI, conçu pour évaluer la capacité d’une IA à rester concentrée même lorsque les interlocuteurs hésitent ou sont interrompus par des bruits de fond, comme une télévision bruyante ou la circulation.
Il ne s’agit pas seulement d’une expérience en laboratoire. De grandes entreprises comme Verizon et The Home Depot testent déjà cette technologie pour améliorer leurs interactions avec les clients. Pour les utilisateurs courants, le changement le plus visible concernera Gemini Live et Search Live.
Si vous utilisez Gemini pour trouver des idées, le modèle peut désormais suivre votre fil de pensée deux fois plus longtemps que la version précédente. Il se déploie également à l’échelle mondiale. Search Live s’étend à plus de 200 pays et prend en charge plus de 90 langues, afin que chacun puisse avoir des conversations multimodales en temps réel dans sa langue maternelle.
Préserver le réel grâce au filigranage
Alors que l’IA n’a jamais semblé aussi humaine, Google ajoute une balise de sécurité numérique à tout ce que produit le modèle.
Chaque fichier audio généré par 3.1 Flash Live intègre SynthID. Il s’agit d’un filigrane inaudible pour les humains, mais détectable par les logiciels, qui contribue à empêcher l’utilisation de paroles générées par l’IA pour diffuser de fausses informations.
À lire également : pour en savoir plus sur les dernières fonctionnalités de navigation de Google dopées à l’IA, découvrez comment « Ask Maps » transforme les itinéraires immersifs en temps réel.


