Google a présenté Gemini 3.1 Flash TTS, un nouveau modèle de synthèse vocale conçu pour rendre les voix synthétiques plus naturelles, plus expressives et plus faciles à contrôler.
Gemini 3.1 Flash TTS se distingue déjà dans les benchmarks du secteur. Selon Artificial Analysis, le modèle a obtenu 1 211 points Elo dans son classement TTS, établi à partir de tests d’écoute à l’aveugle impliquant des milliers de comparaisons humaines.
Il se classe ainsi deuxième au niveau mondial, juste derrière Inworld TTS 1.5 Max (1 215), et devant ElevenLabs Eleven v3 (1 179). Artificial Analysis a également classé le modèle dans son « quadrant le plus attractif », soulignant son équilibre entre une sortie vocale de haute qualité et un coût relativement faible.
L’une des fonctionnalités phares de Gemini 3.1 Flash TTS est l’introduction de balises audio, un système qui permet aux utilisateurs de contrôler la façon dont le texte est prononcé grâce à de simples instructions textuelles.
Les développeurs peuvent insérer directement des balises dans les scripts afin d’ajuster le ton, le rythme et l’expression en temps réel.
Selon certaines informations, le modèle prend en charge plus de 200 balises de ce type, offrant un niveau de contrôle rarement proposé par les systèmes TTS traditionnels. Cette approche de promptage intégré permet aux utilisateurs de façonner la sortie vocale sans recourir à une ingénierie audio complexe, ce qui facilite l’expérimentation et le perfectionnement des expériences vocales.
Le modèle prend en charge plus de 70 langues, ainsi que des variantes d’accents régionaux. Cela comprend plusieurs accents anglais, des variantes américaines aux accents britanniques comme le RP et celui de Brixton, ainsi qu’un large éventail de langues du monde entier. Pour les utilisateurs de Workspace, l’intégration à Google Vids ajoute 30 options de voix conversationnelles dans 24 langues, améliorant l’accessibilité et la localisation pour les créateurs de contenu et les entreprises.
Des mesures de sécurité grâce au filigranage intégré
Pour répondre aux préoccupations liées aux contenus générés par IA, tous les contenus audio produits par Gemini 3.1 Flash TTS intègrent le filigranage SynthID. Selon l’annonce de l’entreprise, « Ce filigrane imperceptible est directement intégré à la sortie audio, permettant de détecter de manière fiable les contenus générés par IA afin de contribuer à prévenir la désinformation. »
Ce filigrane n’est pas audible, mais il peut être détecté pour vérifier si un extrait a été généré par une IA. Google indique que cette approche vise à aider à identifier les contenus synthétiques et à réduire le risque de désinformation.
Comment y accéder
Gemini 3.1 Flash TTS est disponible dès maintenant. Les développeurs peuvent y accéder en version préliminaire via l’API Gemini et Google AI Studio. Les équipes d’entreprise peuvent le tester sur Vertex AI. Quant aux utilisateurs de Workspace, ils le trouveront dans Google Vids.
À lire aussi : L’offensive IA de Google en mars a enrichi Gemini avec des outils plus proactifs, une personnalisation plus poussée et de nouvelles options pour les créateurs et les développeurs.


