Le 30 juillet, OpenAI a annoncé d’importantes baisses de prix pour deux modèles de sa famille GPT-5.6, réduisant de 80 % le coût de GPT-5.6 Luna et de 20 % celui de GPT-5.6 Terra.
GPT-5.6 Luna, le modèle le plus rapide et le moins coûteux de l’entreprise, coûte désormais 0,20 dollar US par million de tokens en entrée et 1,20 dollar US par million de tokens en sortie. Terra, présenté comme l’option intermédiaire pour les tâches courantes, passe à 2 dollars US par million de tokens en entrée et à 12 dollars US par million de tokens en sortie.
Le PDG d’OpenAI, Sam Altman, a annoncé cette décision sur X, les qualifiant de « fortes baisses de prix aujourd’hui », notamment la réduction de 80 % pour Luna et celle de 20 % pour Terra. L’entreprise a expliqué que ces baisses résultaient d’améliorations apportées à ses modèles, à ses systèmes d’inférence et à ses outils d’agent, permettant aux modèles GPT-5.6 d’accomplir les tâches plus efficacement.
Une intelligence intensive à faible coût
Cette évolution tarifaire place GPT-5.6 Luna directement en concurrence avec les offres d’inférence à bas coût de fournisseurs rivaux, notamment Gemini 3.5 Flash-Lite de Google ainsi qu’avec les offres de jeunes pousses chinoises.
Selon les évaluations comparatives citées par OpenAI, Luna égale les capacités de modèles de pointe d’il y a un an pour environ 6 centimes du dollar par tâche, tout en s’exécutant près de neuf fois plus vite. Sur le benchmark professionnel Agents' Last Exam, OpenAI affirme que Luna surpasse Claude Fable 5 d’Anthropic « avec un coût estimé par tâche inférieur de près de 99 % ».
OpenAI a attribué ces baisses de prix aux gains d’efficacité internes obtenus de manière autonome par GPT-5.6 Sol lui-même. Dans le cadre d’un processus d’ingénierie piloté par des humains, Sol a modifié des noyaux logiciels de production et mené des expérimentations sur la génération de tokens. Selon l’entreprise, ces ajustements automatisés ont réduit de 20 % les coûts de mise à disposition des modèles de bout en bout et amélioré de plus de 15 % l’efficacité de génération des tokens.
Du simple accès aux modèles à l’économie unitaire
Alors que l’adoption en entreprise passe du déploiement expérimental aux flux de travail opérationnels intensifs, les développeurs d’IA font l’objet d’une attention accrue concernant le retour sur investissement.
La forte baisse du coût par token reflète une évolution de la stratégie de marché dans laquelle l’accès à une intelligence de base se banalise rapidement.
Plutôt que de se concurrencer uniquement sur les indicateurs bruts de performance au sommet de leur gamme, les fournisseurs d’IA se livrent de plus en plus concurrence sur l’économie unitaire afin de fidéliser les entreprises qui exécutent en continu des systèmes agentiques en plusieurs étapes.
Pour les acheteurs de technologies en entreprise, ces ajustements rendent économiquement viables à grande échelle des flux de travail agentiques complexes, comme la génération de code en plusieurs étapes, l’analyse de documents et le routage automatisé.
En abaissant fortement le prix plancher de modèles légers comme Luna tout en facturant au prix fort le traitement axé sur la latence de Sol, OpenAI encourage ses clients à orchestrer des architectures composées de plusieurs modèles : les nœuds moins coûteux prennent en charge les étapes courantes, tandis que le raisonnement haut de gamme est réservé aux goulots d’étranglement complexes.
Consultez notre guide des tarifs de l’IA qui compare les coûts actuels de ChatGPT, Claude, Gemini, des générateurs d’images, des outils vidéo et des solutions d’IA vocale.


