La plupart des modèles d’IA vocale nécessitent des GPU coûteux et des API cloud pour générer de la parole. Pas vraiment idéal si vous développez un assistant vocal ou si vous voulez simplement cloner votre voix sans épuiser vos crédits de calcul.
Kyutai vient de lancer Pocket TTS, un modèle de synthèse vocale si petit (100 millions de paramètres) qu’il fonctionne plus vite qu’en temps réel sur votre processeur — sans GPU sophistiqué.
Le modèle offre un clonage vocal de haute qualité à partir de seulement 5 secondes d’audio. Donnez-lui 5 secondes de la voix de quelqu’un, et il en reproduira le timbre, l’accent, l’émotion, ainsi que l’acoustique de la pièce et la qualité du microphone.
Un peu comme votre neveu qui imite à la perfection cette vidéo TikTok agaçante TikTok qu’il regarde en boucle : vous pouvez désormais en faire autant. La famille élargie de quelqu’un d’autre interdit-elle aussi l’expression « 6-7 » depuis le Thanksgiving de l’an dernier ?

Les chiffres parlent d’eux-mêmes
- Une précision de premier ordre : le taux d’erreur de mots le plus faible (1,84 %) parmi les concurrents — y compris des modèles 7 fois plus volumineux.
- Vraiment portable : fonctionne sur les processeurs Apple M3 ou Intel Core Ultra sans circuit graphique dédié.
- Tout est ouvert : entièrement open source sous licence MIT, avec l’intégralité du code d’entraînement et 88 000 heures de données publiques.
Cette avancée repose sur les Continuous Audio Language Models (CALM), un nouveau framework qui prédit directement l’audio au lieu de commencer par le convertir en jetons discrets. Cela élimine le goulet d’étranglement informatique qui rendait les précédents modèles de synthèse vocale dépendants des GPU.
Pourquoi c’est important
L’IA vocale vient de devenir accessible à tout développeur (ou même à vous) disposant d’un ordinateur portable (plus besoin d’un abonnement coûteux à ElevenLabs — mais inutile de les plaindre : ils viennent d’atteindre 330 millions de dollars US de revenus récurrents annualisés, soit un ARR égal à un chiffre d’affaires récurrent annualisé).
Ce que vous pouvez faire aujourd’hui et qui était impossible hier:
- Un développeur de jeux indépendant peut ajouter 50 voix de personnages uniques sans engager un seul comédien ni payer d’appels à une API cloud
- Une personne atteinte de SLA peut sauvegarder sa voix sur un ordinateur portable avant qu’elle ne se dégrade, en conservant son identité dans un fichier privé qu’elle contrôle.
- Un professeur de langues crée en une après-midi des guides de prononciation avec sa propre voix pour 200 mots de vocabulaire.
L’aspect confidentialité est le plus important. Jusqu’à présent, cloner une voix signifiait envoyer des fichiers audio sur les serveurs de quelqu’un d’autre. Dictée médicale, dépositions judiciaires, communications professionnelles confidentielles : tout cela nécessitait de faire confiance à un tiers. Désormais ? Votre voix ne quitte jamais votre machine.
Les développeurs peuvent commencer à utiliser Pocket TTS dès maintenant ; si vous voulez l’essayer vous-même, le rapport technique complet de Kyutai contient les instructions d’installation et des échantillons vocaux.
Note de la rédaction : cet article a d’abord été publié dans la newsletter de notre publication sœur, The Neuron. Pour découvrir d’autres articles de The Neuron, inscrivez-vous à sa newsletter ici.


