OpenAI a rendu sa Realtime API, qui connecte des modèles d’IA à des applications pour des interactions en direct, accessible à tous. L’entreprise a également lancé un nouveau modèle vocal appelé gpt-realtime.
La Realtime API et le modèle gpt-realtime sont conçus pour alimenter des agents vocaux d’IA dans des cas d’usage comme le support client, lorsqu’un client appelle une ligne d’assistance et échange directement avec un agent d’IA. Alors que d’autres API combinent des modèles distincts de conversion de la parole en texte et de synthèse vocale, la Realtime API fonctionne comme un système de conversion de la parole en parole, ce qui réduit la latence et capture les subtilités de la conversation pour des interactions plus naturelles. Avec sa disponibilité élargie, la Realtime API introduit de nouvelles fonctionnalités, notamment les entrées d’images, les prompts réutilisables et la connectivité téléphonique.
Le modèle gpt-realtime apporte également des améliorations significatives par rapport à son prédécesseur, gpt-realtime-preview, dans le suivi des instructions, l’utilisation d’outils et la génération d’une voix plus humaine.
« Une conversation à la sonorité naturelle est essentielle au déploiement d’agents vocaux dans le monde réel », a déclaré OpenAI dans un article de blog. « Les modèles doivent parler avec l’intonation, l’émotion et le rythme d’un être humain pour créer une expérience agréable et encourager une conversation continue avec les utilisateurs. »
Les nouvelles fonctionnalités de la Realtime API permettent notamment aux utilisateurs d’appeler une IA avec leur téléphone
Quatre nouvelles fonctionnalités ont été ajoutées à la Realtime API : la prise en charge des serveurs Model Context Protocol (MCP), les entrées d’images, les appels téléphoniques via le Session Initiation Protocol (SIP) et les prompts réutilisables.
L’API permet à une session de se connecter à un serveur MCP distant, un plug-in qui fournit des outils ou des compétences supplémentaires, en transmettant son URL dans la configuration. Une fois la connexion établie, tous les outils de ce serveur deviennent immédiatement disponibles, sans intégration manuelle.
Les images, photos et captures d’écran peuvent désormais être envoyées à une session de la Realtime API en complément de l’audio ou du texte. Le modèle peut ainsi comprendre ce qui est représenté visuellement et y répondre, par exemple en lisant le texte d’une capture d’écran ou en décrivant le contenu d’une image.
La prise en charge du SIP par la Realtime API lui permet de se connecter directement aux réseaux téléphoniques, aux systèmes PBX et aux téléphones de bureau, afin que les utilisateurs puissent avoir une conversation téléphonique en temps réel avec l’IA. Elle permet également aux utilisateurs d’enregistrer et de réutiliser des prompts d’une session à l’autre.
gpt-realtime peut détecter les rires, modifier son ton pour passer du direct au chaleureux, et bien plus encore
OpenAI affirme que gpt-realtime est son modèle de conversion de la parole en parole le plus avancé à ce jour, avec des améliorations de la qualité audio, de l’intelligence, du suivi des instructions et des appels de fonctions.
Le modèle a été entraîné pour produire une voix de meilleure qualité et peut répondre à des prompts lui demandant de modifier sa façon de parler, comme « parle rapidement et de manière professionnelle » ou « parle avec empathie avec un accent français ». Sa précision sur le benchmark MultiChallenge, qui mesure les performances dans les conversations à plusieurs tours, a progressé de 10,1 % par rapport à la version de décembre 2024.
gpt-realtime répond également de manière plus intelligente aux commandes vocales : il détecte des indices non verbaux comme les rires, change de langue en cours de phrase, adapte son ton au contexte de la conversation et identifie des séquences alphanumériques dans différentes langues. Cette mise à jour a augmenté de 17,2 % son score au benchmark Big Bench Audio, qui évalue les capacités de raisonnement des modèles de langage prenant en charge les entrées audio.
Un meilleur respect des instructions et des appels de fonctions améliorés
OpenAI a amélioré le respect par gpt-realtime de ses prompts principaux, de sorte que même les instructions subtiles sont suivies de manière plus fiable tout au long d’une conversation. Cette capacité est mesurée par le benchmark audio MultiChallenge, dont le score a progressé de 9,9 %.
Enfin, les appels de fonctions de gpt-realtime ont été améliorés : les outils qu’il sélectionne sont plus pertinents, invoqués à des moments plus appropriés et alimentés par des données plus précises. Le modèle est également plus performant dans les appels de fonctions asynchrones, ce qui signifie qu’il peut poursuivre une conversation fluide en attendant les résultats d’un appel de fonction.
Les huit voix existantes du modèle bénéficieront toutes de ces mises à jour, ainsi que de deux nouvelles voix baptisées Cedar et Marin.
Tarifs et disponibilité
La Realtime API désormais généralement disponible et le modèle gpt-realtime sont tous deux accessibles. La tarification de gpt-realtime est la suivante :
- 32 dollars US par million de tokens d’entrée audio
- 0,40 dollar US par million de tokens d’entrée mis en cache
- 64 dollars US par million de tokens de sortie audio
Les développeurs peuvent également définir des limites de tokens et tronquer plusieurs tours à la fois afin de réduire le coût des sessions plus longues.
Lisez une analyse approfondie de ces lancements d’OpenAI sur notre site partenaire The Neuron.

