OpenAI dévoile son modèle vocal d’IA le plus avancé à ce jour et les nouveautés de la Realtime API

A screenshot from OpenAI showing colorful sound waves over a bright abstract background.

Image: OpenAI

Written By
Fiona Jackson
Fiona Jackson
Aug 28, 2025
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenAI a rendu sa Realtime API, qui connecte des modèles d’IA à des applications pour des interactions en direct, accessible à tous. L’entreprise a également lancé un nouveau modèle vocal appelé gpt-realtime.

La Realtime API et le modèle gpt-realtime sont conçus pour alimenter des agents vocaux d’IA dans des cas d’usage comme le support client, lorsqu’un client appelle une ligne d’assistance et échange directement avec un agent d’IA. Alors que d’autres API combinent des modèles distincts de conversion de la parole en texte et de synthèse vocale, la Realtime API fonctionne comme un système de conversion de la parole en parole, ce qui réduit la latence et capture les subtilités de la conversation pour des interactions plus naturelles. Avec sa disponibilité élargie, la Realtime API introduit de nouvelles fonctionnalités, notamment les entrées d’images, les prompts réutilisables et la connectivité téléphonique.

Le modèle gpt-realtime apporte également des améliorations significatives par rapport à son prédécesseur, gpt-realtime-preview, dans le suivi des instructions, l’utilisation d’outils et la génération d’une voix plus humaine.

« Une conversation à la sonorité naturelle est essentielle au déploiement d’agents vocaux dans le monde réel », a déclaré OpenAI dans un article de blog. « Les modèles doivent parler avec l’intonation, l’émotion et le rythme d’un être humain pour créer une expérience agréable et encourager une conversation continue avec les utilisateurs. »

Les nouvelles fonctionnalités de la Realtime API permettent notamment aux utilisateurs d’appeler une IA avec leur téléphone

Quatre nouvelles fonctionnalités ont été ajoutées à la Realtime API : la prise en charge des serveurs Model Context Protocol (MCP), les entrées d’images, les appels téléphoniques via le Session Initiation Protocol (SIP) et les prompts réutilisables.

L’API permet à une session de se connecter à un serveur MCP distant, un plug-in qui fournit des outils ou des compétences supplémentaires, en transmettant son URL dans la configuration. Une fois la connexion établie, tous les outils de ce serveur deviennent immédiatement disponibles, sans intégration manuelle.

Advertisement

Les images, photos et captures d’écran peuvent désormais être envoyées à une session de la Realtime API en complément de l’audio ou du texte. Le modèle peut ainsi comprendre ce qui est représenté visuellement et y répondre, par exemple en lisant le texte d’une capture d’écran ou en décrivant le contenu d’une image.

La prise en charge du SIP par la Realtime API lui permet de se connecter directement aux réseaux téléphoniques, aux systèmes PBX et aux téléphones de bureau, afin que les utilisateurs puissent avoir une conversation téléphonique en temps réel avec l’IA. Elle permet également aux utilisateurs d’enregistrer et de réutiliser des prompts d’une session à l’autre.

gpt-realtime peut détecter les rires, modifier son ton pour passer du direct au chaleureux, et bien plus encore

OpenAI affirme que gpt-realtime est son modèle de conversion de la parole en parole le plus avancé à ce jour, avec des améliorations de la qualité audio, de l’intelligence, du suivi des instructions et des appels de fonctions.

Le modèle a été entraîné pour produire une voix de meilleure qualité et peut répondre à des prompts lui demandant de modifier sa façon de parler, comme « parle rapidement et de manière professionnelle » ou « parle avec empathie avec un accent français ». Sa précision sur le benchmark MultiChallenge, qui mesure les performances dans les conversations à plusieurs tours, a progressé de 10,1 % par rapport à la version de décembre 2024.

gpt-realtime répond également de manière plus intelligente aux commandes vocales : il détecte des indices non verbaux comme les rires, change de langue en cours de phrase, adapte son ton au contexte de la conversation et identifie des séquences alphanumériques dans différentes langues. Cette mise à jour a augmenté de 17,2 % son score au benchmark Big Bench Audio, qui évalue les capacités de raisonnement des modèles de langage prenant en charge les entrées audio. 

Un meilleur respect des instructions et des appels de fonctions améliorés

OpenAI a amélioré le respect par gpt-realtime de ses prompts principaux, de sorte que même les instructions subtiles sont suivies de manière plus fiable tout au long d’une conversation. Cette capacité est mesurée par le benchmark audio MultiChallenge, dont le score a progressé de 9,9 %.

Enfin, les appels de fonctions de gpt-realtime ont été améliorés : les outils qu’il sélectionne sont plus pertinents, invoqués à des moments plus appropriés et alimentés par des données plus précises. Le modèle est également plus performant dans les appels de fonctions asynchrones⁠, ce qui signifie qu’il peut poursuivre une conversation fluide en attendant les résultats d’un appel de fonction.

Les huit voix existantes du modèle bénéficieront toutes de ces mises à jour, ainsi que de deux nouvelles voix baptisées Cedar et Marin.

Tarifs et disponibilité

Advertisement

La Realtime API désormais généralement disponible et le modèle gpt-realtime sont tous deux accessibles. La tarification de gpt-realtime est la suivante :

  • 32 dollars US par million de tokens d’entrée audio
  • 0,40 dollar US par million de tokens d’entrée mis en cache
  • 64 dollars US par million de tokens de sortie audio

Les développeurs peuvent également définir des limites de tokens et tronquer plusieurs tours à la fois afin de réduire le coût des sessions plus longues.

Lisez une analyse approfondie de ces lancements d’OpenAI sur notre site partenaire The Neuron.

Fiona Jackson

Fiona Jackson is a news writer who started her journalism career at SWNS press agency, later working at MailOnline, an advertising agency, and TechnologyAdvice. Her work spans human interest and consumer tech reporting, appearing in prominent media outlets such as TechHQ, The Independent, Daily Mail, and The Sun.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.