Claude Opus 4.8 fait ses débuts, Anthropic promettant une « honnêteté accrue »

A split-screen minimalist graphic with handwritten loops on grid paper beside a black outline hand pointing to a white neural network icon.

Image: Anthropic

May 28, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Anthropic affirme que son dernier modèle d’IA sait mieux admettre qu’il peut se tromper.

Le laboratoire d’intelligence artificielle a lancé jeudi Claude Opus 4.8, une version améliorée de son principal modèle généralement disponible. Selon l’entreprise, cette version apporte des améliorations mesurables dans les benchmarks de codage, de raisonnement et de travail intellectuel pratique, tout en conservant des coûts standards identiques à ceux de son prédécesseur, Opus 4.7.

Le déploiement d’Opus 4.8 met principalement l’accent sur la fiabilité du modèle et sur ce qu’Anthropic décrit comme une honnêteté accrue. L’entreprise a souligné que les modèles d’IA « sautent fréquemment aux conclusions », affirmant avec assurance avoir progressé dans leur travail alors que les éléments disponibles sont minces. »

Pour y remédier, le nouveau modèle a été entraîné à signaler plus facilement les lacunes de sa propre confiance et à éviter les affirmations non étayées. Les évaluations internes indiquent qu’Opus 4.8 est environ 4 fois moins susceptible qu’Opus 4.7 de laisser passer sans le signaler un défaut dans le code qu’il a écrit.

Les premiers testeurs ont constaté que le système avait davantage tendance à signaler les incertitudes concernant son travail plutôt qu’à afficher une confiance injustifiée.

La mise à niveau a également enregistré des progrès généralisés sur les benchmarks publiés :

  • Codage agentique (Terminal-Bench 2.1) : Est passé de 64,3 % à 69,2 %.
  • Raisonnement multidisciplinaire avec outils : Est passé de 54,7 % à 57,9 %.
  • Utilisation agentique de l’ordinateur : Est passée de 82,8 % à 83,4 %.
  • Travail intellectuel :Les scores sont passés de 1 753 à 1 890.

L’équipe d’Anthropic chargée de l’alignement a déclaré que le modèle « atteint de nouveaux sommets dans nos mesures des traits prosociaux, comme le soutien à l’autonomie de l’utilisateur et l’action dans son intérêt », ramenant les comportements trompeurs ou mal alignés à des niveaux proches de ceux de ses modèles en préversion limitée.

Nouveaux contrôles et sous-agents parallèles

Plusieurs mises à jour d’outils sont lancées en parallèle du modèle afin de donner aux utilisateurs davantage de contrôle sur les coûts opérationnels et la puissance de calcul.

Advertisement

Un nouveau panneau de contrôle de l’effort sur claude.ai et Cowork permet aux utilisateurs d’ajuster manuellement l’intensité du traitement de Claude. La sélection de configurations exigeant davantage d’effort incite le modèle à réfléchir plus souvent et plus en profondeur pour les tâches complexes, ce qui consomme davantage de tokens. Les réglages demandant moins d’effort accélèrent les temps de réponse et préservent les limites de débit pour les tâches plus simples.

Pour le développement logiciel, Anthropic a présenté une fonctionnalité en préversion de recherche appelée « workflows dynamiques » dans Claude Code. Cette fonctionnalité permet au système d’organiser, de planifier et d’exécuter des projets de très grande ampleur en déployant des centaines de sous-agents parallèles au cours d’une même session. 

L’entreprise affirme que Claude peut ainsi exécuter des migrations à l’échelle d’une base de code, portant sur des centaines de milliers de lignes de code, du lancement à la fusion, en utilisant les suites de tests existantes comme référence pour la validation.

Pour les développeurs utilisant l’API Messages, Anthropic a ajouté la possibilité d’accepter des entrées système au sein du tableau de messages. Les ingénieurs peuvent ainsi ajuster les instructions, le contexte de l’environnement ou les budgets de tokens en cours de tâche, sans interrompre le cache d’invite ni attendre une intervention de l’utilisateur.

Mythos se profile en arrière-plan

Alors même qu’Anthropic déploie Opus 4.8, l’entreprise s’oriente déjà vers une famille de systèmes d’IA plus avancés.

Anthropic a déclaré prévoir de lancer « une nouvelle catégorie de modèle doté d’une intelligence encore supérieure à celle d’Opus » dans les prochaines semaines. Ces systèmes sont associés à Project Glasswing et à Claude Mythos Preview, actuellement testés par un petit nombre d’organisations pour des travaux de cybersécurité. 

Selon Anthropic, les modèles de la classe Mythos nécessitent des garde-fous renforcés avant un déploiement plus large en raison de leurs capacités avancées en cybersécurité.

À lire aussi : Google’s Gemini 3.5 Flash and Antigravity 2.0 ajoutent un nouveau défi de codage en entreprise pour Anthropic et OpenAI. 


Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.