Parler à ChatGPT va bientôt devenir beaucoup moins haché.
OpenAI a lancé GPT-Live, une nouvelle famille de modèles vocaux capables d’écouter les utilisateurs pendant qu’ils parlent et de répondre sans attendre qu’ils aient fini. L’entreprise indique que le déploiement commence cette semaine à l’échelle mondiale : GPT-Live-1 deviendra l’expérience vocale par défaut pour les abonnés Go, Plus et Pro, tandis que GPT-Live-1 mini alimentera les comptes gratuits. Le déploiement commence cette semaine à l’échelle mondiale.
L’entreprise a déclaré que GPT-Live remplace l’ancien mode vocal avancé par une architecture full duplex qui traite continuellement l’audio, permettant une alternance plus naturelle des tours de parole, moins d’interruptions gênantes et des conversations plus rapides.
Si la fluidité accrue des conversations constitue le bénéfice immédiat, l’enjeu plus large réside dans la vision d’OpenAI : faire de la voix le principal moyen par lequel les utilisateurs interagissent avec des agents d’IA toujours plus capables, qui peuvent effectuer des recherches sur le Web, résoudre des problèmes et accomplir des tâches en arrière-plan.
La voix reste active pendant que GPT-5.5 s’occupe des tâches plus complexes
L’un des principaux changements concerne la manière dont GPT-Live sépare la conversation des tâches d’IA plus exigeantes.
OpenAI a déclaré que le modèle vocal pouvait transmettre les demandes nécessitant une recherche sur le Web, un raisonnement plus approfondi ou des capacités d’agent à son dernier modèle de pointe, tout en poursuivant la conversation.
Au lancement, GPT-5.5 s’occupe de ces tâches en arrière-plan avant de renvoyer les résultats dans la conversation vocale en cours.
L’entreprise a également indiqué que GPT-Live pouvait décider plusieurs fois par seconde s’il devait parler, faire une pause, continuer à écouter, interrompre l’utilisateur ou utiliser un outil. Cette approche permet aussi d’intégrer des fonctionnalités telles que la traduction en direct et laisse les utilisateurs marquer naturellement une pause sans que l’assistant ne les interrompe par erreur.
Le pari plus ambitieux
OpenAI présente la voix comme une future couche de contrôle pour le travail avec l’IA en général.
Atty Eleti, ChatGPT Voice Product Lead, a raconté avoir eu des conversations de 30 à 40 minutes avec la fonctionnalité vocale pendant ses promenades. Selon lui, la voix pourrait devenir « une sorte d’interface principale pour l’informatique et pour gérer un travail agentique de plus en plus complexe et de longue durée », à l’image de la manière dont les utilisateurs se servent déjà d’outils de programmation comme Codex.
Cette ambition place OpenAI dans un secteur très concurrentiel. Apple et Amazon ont tous deux amélioré leurs assistants en leur donnant une meilleure gestion du contexte, tandis que des start-up comme Sesame et Monogram tentent de s’imposer sur le même terrain avec des assistants plus expressifs et intégrés visuellement.
Ce qui lui fait encore défaut
Le système n’est pas infaillible.
Lors d’une démonstration en direct de la traduction de l’hindi, l’assistant aurait parlé avec un fort accent américain et employé une formulation guindée, « livresque », rappelant qu’un anglais naturel ne se traduit pas automatiquement par une bonne maîtrise des autres langues. OpenAI n’a pas précisé quelles langues avaient bénéficié de l’optimisation la plus poussée.
La question sensible de la dépendance affective se pose également. OpenAI affirme avoir intégré des garde-fous pour les conversations liées à l’automutilation ainsi que des réponses adaptées à l’âge des adolescents, et insiste sur le fait que GPT-Live est conçu comme un assistant, pas comme un compagnon.
À mesure que les assistants vocaux acquièrent une voix plus humaine, la frontière entre outil utile et béquille émotionnelle devient plus difficile à surveiller, un phénomène qu’OpenAI dit vouloir suivre au moyen de recherches continues sur la sécurité.
Ce que les utilisateurs pourraient réellement remarquer
Pour la plupart des utilisateurs, ChatGPT pourrait moins ressembler à un chatbot fonctionnant sur le mode question-réponse et davantage à un assistant capable de rester présent pendant une tâche en cours.
Selon les informations publiées sur le déploiement d’OpenAI, GPT-Live peut accuser réception avec de brefs signaux d’écoute, attendre pendant les pauses naturelles et recevoir l’instruction de rester silencieux jusqu’à ce qu’on lui donne la parole. Il peut également prendre en charge la traduction en direct et afficher des éléments visuels dynamiques sur des sujets comme la météo, le sport et les cours de Bourse pendant que la conversation se poursuit.
Ces détails comptent, car ils annoncent un autre type d’interaction avec l’IA. Au lieu de contraindre les utilisateurs à s’arrêter, taper, attendre puis recommencer, GPT-Live est conçu pour les moments où ils marchent, conduisent, cuisinent, cherchent à résoudre un problème, traduisent ou jonglent avec plusieurs tâches à la fois.
À lire aussi : Les rumeurs sur GPT-5.6 font état d’une offensive plus large d’OpenAI en faveur des agents, de l’utilisation d’outils et d’une IA axée sur les flux de travail.


