GPT-6 Astra ou Claude Fable 5.1 : quel modèle les entreprises doivent-elles choisir ?

GPT-6 Astra and Claude Fable 5.1 go head-to-head on performance

GPT-6 Astra and Claude Fable 5.1 go head-to-head on performance, pricing, and enterprise use cases. Image generated via ChatGPT. Image: Generated via Google’s Nano Banana

Sep 8, 2026
11 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Deux entreprises spécialisées dans l’IA ont lancé leurs meilleurs modèles à 48 heures d’intervalle, les ont tarifés exactement au cent près, et ne parviennent désormais pas à s’entendre sur le véritable vainqueur.

GPT-6 Astra est arrivé le 3 septembre, deux jours après Claude Fable 5.1, les deux entreprises facturant 10 dollars par million de tokens en entrée et 50 dollars par million de tokens en sortie. Mais aucun des deux fournisseurs n’a comparé directement son nouveau modèle à celui de l’autre lors du lancement, laissant aux tests indépendants le soin de combler les lacunes les plus importantes.

Et ces tests ne désignent pas un vainqueur universel. Fable 5.1 arrive en tête dans plusieurs évaluations neutres du raisonnement, tandis qu’Astra s’impose dans d’autres domaines et peut utiliser moins de tokens par tâche terminée — ce qui signifie que le meilleur modèle dépend largement de ce qu’une entreprise lui demande réellement de faire.

C’est là que l’accord prend fin. Aucune des deux entreprises n’a comparé son modèle à celui de l’autre, car aucun des deux n’existait encore au moment des tests. Anthropic a testé Fable 5.1 face à l’ancien GPT-5.6 Sol d’OpenAI.  OpenAI a lui aussi testé Astra principalement face à son propre prédécesseur. 

Le seul arbitre véritablement neutre de ce duel est Artificial Analysis, un évaluateur indépendant qui a soumis les deux modèles aux mêmes tests — et a désigné Fable 5.1 vainqueur dans ses deux principaux indices, alors même que les propres graphiques d’OpenAI montrent Astra en tête presque partout ailleurs.

La véritable question porte donc moins sur le modèle « meilleur » que sur celui qui convient à une charge de travail donnée.

Pourquoi cette comparaison est importante

Les entreprises n’achètent pas des trophées de benchmarks. Elles achètent le modèle qui exécute leurs charges de travail de manière fiable à un coût acceptable.

Advertisement

Astra et Fable 5.1 affichant les mêmes tarifs d’API, comparer le prix en dollars par million de tokens ne suffit pas. Les acheteurs doivent également prendre en compte la consommation de tokens, la tarification du cache, la longueur du contexte, l’utilisation d’outils, les taux d’achèvement des tâches et l’infrastructure qui entoure chaque modèle.

Ce duel illustre donc utilement la manière dont les entreprises doivent de plus en plus évaluer les modèles d’IA : en fonction de leurs propres charges de travail, et non du benchmark préféré d’un fournisseur.

Ce que disent réellement les benchmarks

Selon le graphique auquel on se fie, chacun des deux modèles peut prétendre à la couronne.

Dans le propre tableau comparatif d’OpenAI, Astra arrive en tête dans presque toutes les lignes publiées : 97,6 % sur FrontierMath Tier 4 contre 87,8 % pour Fable 5.1, et 96,0 % contre 93,7 % sur GPQA Diamond. Astra affiche également une large avance sur Terminal-Bench Science, un benchmark de recherche agentique, avec 64,6 % contre 52,6 % pour Fable 5.1.

En se tournant vers Artificial Analysis, Fable 5.1 arrive en tête. L’Intelligence Index de l’entreprise — qui regroupe neuf évaluations du raisonnement, des connaissances et du code dans un même environnement neutre — attribue 66 points à Fable 5.1, la meilleure note jamais enregistrée, contre 61 pour Astra. Fable 5.1 remporte également Humanity’s Last Exam, un vaste test de raisonnement, avec 65,0 % contre 57,2 %.

Les résultats en programmation sont partagés selon l’environnement de test. Les graphiques d’OpenAI donnent l’avantage à Astra sur DeepSWE v1.1 (74,1 % contre 67,4 %) et une avance plus étroite sur Terminal-Bench 4.0. Mais l’indice neutre Coding Agent Index d’Artificial Analysis considère le résultat comme quasiment à égalité, avec 67,0 pour Astra contre 67,2 pour Fable 5.1, tandis que le score SWE-bench Pro publié par Anthropic est de 81,2 pour Fable 5.1 — un benchmark pour lequel OpenAI n’a pas publié de chiffre comparable.

Le groupe de tests indépendant ARC Prize Foundation a effectué ses propres calculs sur le raisonnement abstrait et a constaté qu’Astra obtenait 62,7 % sur ARC-AGI-3 dans un environnement neutre — plus du double des 30,2 % détenus auparavant par Claude Opus 5. Mais la fondation a signalé que le score d’Astra atteignait 99,9 % lorsqu’il était exécuté via l’adaptateur propriétaire d’OpenAI, qui conserve l’état du raisonnement entre les appels — un écart que la fondation attribue à l’ingénierie de gestion du contexte plutôt qu’aux capacités intrinsèques du modèle.

Ce que coûte réellement l’exécution de chaque modèle

La grille tarifaire ne raconte qu’une partie de l’histoire, et c’est sans doute la moins importante.

Sur le papier, les deux modèles appliquent des tarifs identiques pour l’entrée et la sortie, à une exception près : les tokens mis en cache. Anthropic facture 0,25 dollar par million de tokens mis en cache pour Fable 5.1, soit une baisse de 75 % par rapport à son prédécesseur, tandis qu’OpenAI facture 1,00 dollar pour Astra — quatre fois plus. Au-delà de 272 000 tokens en entrée, la tarification d’Astra devient encore plus élevée : le coût de l’entrée et du cache double, tandis qu’une surtaxe de 50 % s’applique à la sortie. Anthropic n’applique aucune surtaxe de ce type sur l’intégralité de sa fenêtre de 1 million de tokens.

Advertisement

Cela semble faire de Fable 5.1 l’option la moins chère pour toute charge de travail impliquant de longs documents ou un contexte répété — et c’est bien le cas dans les scénarios reposant fortement sur la mise en cache. DataCamp a modélisé une charge de travail intensive en cache, avec 100 000 tokens lus 1 000 fois, et a constaté qu’Astra coûtait 201 dollars contre 126 dollars pour Fable 5.1.

Mais lorsqu’on se base sur la consommation réelle de tokens, le récit s’inverse complètement. Artificial Analysis a constaté que Fable 5.1 coûte 3,76 dollars par tâche terminée sur son Intelligence Index avec un effort maximal, contre 1,67 dollar pour Astra — parce qu’Astra utilise tout simplement beaucoup moins de tokens pour parvenir à une réponse. 

Le cabinet de tests indépendant MindStudio a soumis les deux modèles à une suite de benchmarks de programmation identiques et a observé une tendance similaire, mais inversée : Astra a en réalité coûté plus cher lors de ce test, atteignant 198 dollars en tokens contre 113 dollars pour Fable 5.1 sur huit courtes tâches de programmation et quatre projets plus importants de création d’applications — soit une prime d’environ 75 % pour Astra, avec des résultats moins bons sur les travaux les plus complexes selon cet évaluateur.

La contradiction entre les conclusions de DataCamp et de MindStudio sur les coûts est instructive en elle-même : le coût par tâche dépend énormément de la structure du prompt, de l’effort de raisonnement, du taux de succès du cache et de l’environnement de programmation qui exécute le modèle. Il n’existe pas de « modèle le moins cher » dans l’absolu. Il existe seulement un modèle moins cher pour une tâche donnée.

Les domaines où chaque modèle prend l’avantage

La victoire technique la plus nette d’Astra concerne l’utilisation d’un ordinateur — sa capacité à naviguer dans de vrais logiciels, à remplir des formulaires et à utiliser un ordinateur de bureau comme le ferait un humain. OpenAI annonce 72,6 % sur OSWorld 2.0 contre 70,2 % pour Claude Opus 5, ainsi que 92,7 % sur le test de grounding ScreenSpot-Pro. OpenAI affirme également qu’Astra termine les tâches sur ordinateur environ 47 % plus rapidement que son prédécesseur.

La force de Fable 5.1 apparaît dans les tâches prolongées et riches en outils. Anthropic indique que son score a plus que doublé par rapport à celui de son prédécesseur sur Terminal-Bench Science, et il obtient le meilleur score au Coding Agent Index jamais mesuré par Artificial Analysis lorsqu’il est exécuté dans Claude Code précisément, avec 70 points.

La sécurité constitue une histoire à part. OpenAI affirme qu’Astra est le premier modèle à franchir le seuil « Critical » de son cadre interne de gestion des risques, ce qui signifie qu’il peut trouver et élaborer de manière largement autonome des exploits fonctionnels contre des systèmes renforcés — une capacité qu’OpenAI a réservée à un programme à accès limité appelé Daybreak plutôt que de la proposer largement. 

Advertisement

Fable 5.1, en revanche, redirige automatiquement les requêtes signalées liées à la cybersécurité et à la biologie vers un ancien modèle Claude moins performant. Anthropic a indiqué dans sa fiche système que, lors d’un benchmark d’injection indirecte de prompt, environ 23 % de l’ensemble des réponses de Fable 5.1 et près de la moitié de ses réponses de programmation dans ce test étaient en réalité fournies par le modèle de secours plutôt que par Fable 5.1 lui-même — ce qui signifie que le modèle évalué par les clients n’est pas toujours celui qui répond en production.

Les informations publiées par OpenAI sur la sécurité vont également dans les deux sens. Le propre rapport de l’entreprise souligne que le raisonnement d’Astra est plus difficile à interpréter pour les observateurs externes que celui de son prédécesseur, et le UK AI Security Institute a constaté qu’Astra avait tenté des attaques simulées de la chaîne d’approvisionnement dans 60 des 499 échantillons de test lorsqu’il disposait d’un accès général à Internet — un nombre tombé à 2 sur 500 lorsque cet accès était explicitement bloqué.

Greg Brockman, cofondateur et président d’OpenAI, n’a pas minimisé le lancement. Lors d’une présentation à la presse, il a qualifié Astra de bond en avant générationnel et déclaré qu’il pensait que l’entreprise avait peut-être atteint l’intelligence artificielle générale avec cette sortie. OpenAI a également décrit Astra dans ses propres documents comme « le meilleur modèle au monde pour utiliser un ordinateur ». 

Ce qu’a constaté eWeek : le face-à-face pour les entreprises

Les éléments disponibles pointent vers deux modèles optimisés pour des atouts différents plutôt que vers un vainqueur universel.

CatégorieGPT-6 AstraClaude Fable 5.1Évaluation d’eWeek
Tarif de base de l’API10 dollars en entrée/50 dollars en sortie par million de tokens10 dollars en entrée/50 dollars en sortie par million de tokensÉgalité
Tarif des tokens mis en cache1,00 dollar par million0,25 dollar par millionFable 5.1
Surtaxe pour les contextes longs2× pour l’entrée/le cache, 1,5× pour la sortie au-delà de 272 000 tokensAucuneFable 5.1
Programmation dans un terminalRésultats publiés solides ; 74,1 % sur DeepSWE55,8 % sur Terminal-BenchGPT-6 Astra pour les tâches agentiques intensives en shell
Score indépendant d’agent de programmation67 dans Codex70 dans Claude CodeFable 5.1, avec réserve liée à l’environnement de test
Score indépendant d’intelligence (Artificial Analysis)6166Fable 5.1
Efficacité en tokens par tâcheÉlevée (moins de tokens pour terminer la tâche)Modérée (génération de sorties verbeuses)GPT-6 Astra
Utilisation d’un ordinateur/automatisation du poste de travail72,6 % (OSWorld 2.0 hors ligne) ; 92,7 % (ScreenSpot-Pro)77,9 % partiel/41,7 % strict (OSWorld 2.0, août 26)GPT-6 Astra
Artefacts professionnels/CAD95,9 % sur BenchCAD84.3%GPT-6 Astra
Mathématiques avancées (FrontierMath Tier 4)97.6%87.8%GPT-6 Astra
Raisonnement général (Humanity’s Last Exam, avec outils)57.2%65.0%Fable 5.1
Capacités en cybersécurité100 % sur ExploitBench ; seuil CriticalRefus concernant les usages à double usage ; identification des vulnérabilitésGPT-6 Astra pour les opérations défensives autorisées
Transparence en matière de sécuritéFaible observabilité ; risque d’évasion adversarialeRedirection silencieuse vers d’anciens modèles ClaudeÉgalité/compromis
Fenêtre de contexte~1,05 million de tokens~1 million de tokensGPT-6 Astra
Date limite des connaissances30 avril 2026Juin 2026Fable 5.1
Couverture cloudAWS, API OpenAI, programme DaybreakAWS, Google Cloud, Microsoft AzureFable 5.1
Contrôles du raisonnementNiveau d’effort de raisonnement configurable (de faible à maximal) ; mode rapideRéflexion adaptative permanente ; niveau plancher fixe de raisonnementGPT-6 Astra pour le contrôle
Advertisement

Le verdict d’eWeek

Il n’y a pas de vainqueur universel ici — et les éléments disponibles invitent les entreprises à se méfier de quiconque prétend le contraire.

GPT-6 Astra semble le plus performant pour les charges de travail où l’efficacité en tokens, les mathématiques avancées, l’utilisation d’un ordinateur ou un raisonnement étroitement contrôlé sont essentiels. Claude Fable 5.1 a l’avantage en matière de scores de raisonnement indépendants, de lectures de cache moins coûteuses, d’économie sur les longs contextes et de workflows agentiques fondés sur Claude Code.

Le constat le plus important est que des tarifs d’API identiques ne produisent pas des coûts identiques. Selon la charge de travail, l’un ou l’autre modèle peut être moins cher, et le modèle en tête des benchmarks change selon le banc de test utilisé.

Les entreprises qui évaluent les deux modèles devraient donc exécuter leurs charges de travail internes représentatives avec chacun d’eux et mesurer le coût par tâche réussie, plutôt que de se contenter du prix par token ou du classement aux benchmarks. Les éléments publiés sont trop souvent contradictoires pour que l’un ou l’autre modèle s’impose automatiquement.

Choisissez GPT-6 Astra si :

  • Vos agents utilisent des logiciels réels. L’utilisation d’un ordinateur et l’automatisation du poste de travail constituent le domaine de prédilection d’Astra.
  • Vous avez besoin de capacités de raisonnement mathématique ou scientifique. Atteindre 97,6 % au niveau 4 de FrontierMath est une véritable performance.
  • Vous produisez des livrables professionnels. Les présentations, les feuilles de calcul et les sorties CAO figurent parmi les objectifs d’entraînement annoncés.
  • Vous exécutez des tâches irrégulières et de courte durée, pour lesquelles l’efficacité en tokens réduit le coût par tâche.
  • Vous utilisez déjà Codex. Les notes interfenêtres d’Astra sont une fonctionnalité de Codex.
Advertisement

Choisissez Claude Fable 5.1 si :

  • Vous exécutez de longues boucles agentiques où les lectures de cache représentent l’essentiel de la facture. Des lectures de cache quatre fois moins chères produisent un effet cumulatif.
  • Vos requêtes sont volumineuses — aucun supplément quelle que soit leur longueur.
  • Vous voulez le meilleur score de raisonnement indépendant et êtes prêt à le payer. 5 points de plus à l’Intelligence Index.
  • Vous travaillez dans Claude Code. Fable 5.1 dans Claude Code obtient le meilleur score du Coding Agent Index.
  • Vous avez besoin des connaissances les plus récentes. Date limite de juin 2026 contre avril 2026.

Les compromis à surveiller

Aucun des deux modèles ne constitue un choix par défaut sûr. La force d’Astra en cybersécurité est aussi un handicap qu’OpenAI a lui-même signalé, en limitant l’accès général tout en soulignant que le raisonnement interne du modèle est plus difficile à auditer que celui de son prédécesseur. 

Les garde-fous de sécurité de Fable 5.1 sont plus stricts que ceux des modèles Claude antérieurs pour les requêtes liées à la sécurité ou à la biologie, ce qui, selon la propre documentation d’Anthropic, entraîne un taux de refus plus élevé — un coût réel pour toute équipe menant des recherches légitimes en sécurité. 

Et plusieurs des résultats de benchmark les plus spectaculaires des deux camps — le score quasi parfait d’Astra à ARC-AGI-3, les chiffres d’Anthropic sur OSWorld — s’accompagnent de réserves concernant des versions de test incompatibles ou une notation dépendante du banc de test, que ni l’une ni l’autre entreprise ne clarifie entièrement dans ses propres documents. Les acheteurs devraient considérer chaque chiffre de cette comparaison comme un point de départ pour leurs propres tests, et non comme une réponse définitive.

Vous voulez en savoir plus sur les astuces, conseils et techniques de prompting liés à l’IA ? Les lecteurs d’eWeek bénéficient de 7 jours d’accès gratuit à The Neuron Academy, notre plateforme d’apprentissage pratique conçue pour aider les professionnels à utiliser l’IA avec plus d’assurance au travail. Parcourir toutes les leçons →


Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.