Google monte le volume sur Gemini. Cette semaine, l’entreprise a déployé une version améliorée de Gemini 2.5 Flash Native Audio, qui introduit des conversations plus fluides, une meilleure gestion des instructions et la traduction vocale en direct auprès d’un plus grand nombre d’utilisateurs et de produits.
La version mise à jour de Gemini 2.5 Flash Native Audio est conçue pour les interactions vocales en direct, notamment pour les agents d’IA qui répondent en temps réel. La nouvelle version est déjà disponible dans Google AI Studio et Vertex AI pour les développeurs.
Elle est également déployée dans des produits grand public, notamment Gemini Live et Search Live, où les utilisateurs peuvent désormais parler à l’IA de Google plus naturellement.
Des conversations plus naturelles
Selon Google, la mise à jour améliore la capacité de Gemini à gérer des échanges complexes en plusieurs étapes. Le modèle peut désormais mieux se souvenir du contexte des passages précédents d’une conversation, suivre plus précisément les instructions détaillées et récupérer des informations en temps réel sans interrompre le fil de l’échange vocal.
Google a mis en avant trois améliorations majeures :
- un appel de fonctions plus fiable pendant les conversations
- un meilleur suivi des instructions, avec un taux de respect annoncé de 90 %
- une meilleure mémoire sur plusieurs tours pour des conversations plus fluides et plus cohérentes
Ces changements sont destinés à alimenter les agents vocaux en direct, notamment les bots du service client et les assistants en temps réel.
La traduction vocale en direct arrive dans les écouteurs
Parallèlement à la mise à niveau audio, Google lance la traduction vocale en direct propulsée par Gemini. Cette fonctionnalité permet de traduire en temps réel via des écouteurs, tout en préservant le ton, le rythme et la hauteur de voix de l’interlocuteur.
La fonctionnalité bêta est lancée dans l’application Google Translate, d’abord sur les appareils Android aux États-Unis, au Mexique et en Inde, la prise en charge d’iOS et d’autres régions étant prévue ultérieurement. Le système prend en charge plus de 70 langues et peut détecter automatiquement les langues et passer de l’une à l’autre au cours de conversations bidirectionnelles, même dans des environnements bruyants.
À mesure que de plus en plus de personnes commenceront à utiliser les nouvelles fonctionnalités audio, l’entreprise affirme qu’elle continuera de les améliorer, promettant de « continuer à faire évoluer cette expérience ». Google a également confirmé que cette extension concernera « davantage de produits Google, notamment l’API Gemini, en 2026 ».
À lire également : Google affirme que les informations faisant état de l’arrivée de publicités dans l’application Gemini en 2026 sont inexactes.


