Les agents vocaux IA se rapprochent du stade où ils pourront faire plus que d’attendre leur tour de parole.
OpenAI a annoncé jeudi l’extension de son Realtime API avec GPT-Realtime-2, un nouveau modèle vocal qui, selon l’entreprise, apporte un « raisonnement de niveau GPT-5 » aux conversations en direct. Cette version s’adresse aux développeurs qui créent des agents IA capables d’écouter, de répondre, de traduire, de transcrire et d’agir pendant qu’une conversation est encore en cours.
Selon OpenAI, l’objectif est de passer « de simples échanges question-réponse à des interfaces vocales capables d’accomplir un véritable travail : écouter, raisonner, traduire, transcrire et agir au fil de la conversation. »
Cette mise à jour marque un changement dans la façon dont les développeurs conçoivent les agents vocaux IA. Au lieu d’assembler des outils distincts pour entendre, réfléchir et parler, GPT-Realtime-2 gère l’ensemble du processus au sein d’une seule boucle. Cela permet de réduire la latence et de proposer des interactions plus nuancées, par exemple en adaptant le ton aux émotions de l’utilisateur.
Des outils spécialisés pour la traduction et le texte
Parallèlement à son principal modèle de raisonnement, OpenAI a présenté GPT-Realtime-Translate et GPT-Realtime-Whisper, conçus pour prendre en charge des tâches spécifiques à grande vitesse. Le modèle de traduction est conçu pour suivre le rythme d’un locuteur et prend en charge plus de 70 langues en entrée et 13 langues en sortie. Cette fonctionnalité vise des secteurs comme l’éducation et le service client, où la communication en direct entre différentes langues est essentielle.
Le troisième ajout, GPT-Realtime-Whisper, se concentre sur la « conversion de la parole en texte en continu ». Selon OpenAI, ce modèle « transcrit l’audio au fur et à mesure que les gens parlent, afin que les produits en direct paraissent plus rapides, plus réactifs et plus naturels — des sous-titres qui apparaissent instantanément aux notes de réunion qui suivent le fil de la conversation. »
Applications concrètes et usage en entreprise
Plusieurs grandes entreprises ont déjà commencé à intégrer ces modèles à leurs plateformes. Parmi les premiers testeurs figurent la marketplace immobilière Zillow, le site de voyage Priceline et l’opérateur européen Deutsche Telekom.
Zillow développe par exemple un assistant capable de raisonner sur des recherches vocales complexes, comme trouver des logements dans un budget donné, éviter les rues très fréquentées et programmer des visites le week-end. De son côté, Vimeo utilise le modèle de traduction pour proposer des mises à jour en direct de vidéos de formation aux produits dans plusieurs langues.
Pour prendre en charge ces workflows agentiques plus complexes, OpenAI a étendu la fenêtre de contexte de son modèle vocal phare, la faisant passer de 32 k à 128 k jetons. L’IA peut ainsi mémoriser une bien plus grande partie d’une conversation, un changement important pour les ingénieurs qui devaient auparavant créer des réinitialisations manuelles afin d’éviter les défaillances des sessions vocales.
Tarification et garde-fous de sécurité
Les nouveaux modèles sont proposés selon une tarification à plusieurs niveaux. GPT-Realtime-2 coûte 32 dollars US par million de jetons audio en entrée et 64 dollars US par million de jetons en sortie. Les modèles spécialisés sont facturés à la minute : GPT-Realtime-Translate coûte 0,034 dollar US par minute et GPT-Realtime-Whisper est facturé 0,017 dollar US par minute.
OpenAI a également mis en place des mesures de sécurité pour empêcher l’utilisation de ces outils à des fins de fraude ou de spam. L’entreprise a intégré des déclencheurs afin que « les conversations puissent être interrompues si elles sont détectées comme enfreignant nos règles relatives aux contenus nuisibles ». Le Realtime API prend également en charge EU Data Residency pour les applications basées en Europe et respecte les engagements existants de l’entreprise en matière de confidentialité des données des entreprises.
Les développeurs peuvent commencer à tester immédiatement les nouveaux modèles via OpenAI Playground ou la plateforme Codex de l’entreprise.
À lire également : pour en savoir plus sur les dernières mises à jour des modèles d’OpenAI, consultez notre article sur GPT-5.5 Instant devient le modèle par défaut de ChatGPT.

