OpenAI et Anthropic se sont mutuellement soumis à des tests de résistance de leurs IA : voici ce qu’ils ont découvert

Coworkers collaborating on artificial intelligence project in modern office

Image: Envato/sofiiashunkina

Written By
Megan Crouse
Megan Crouse
Aug 28, 2025
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenAI et Anthropic ont publié des évaluations de sécurité portant sur les modèles d’IA générative de l’autre entreprise, accessibles au public, en examinant leur vulnérabilité aux hallucinations et aux attaques par injection de prompt. Les résultats étaient contrastés.  

OpenAI a mené des tests de sécurité et de désalignement sur les modèles d’Anthropic Claude Opus 4 et Claude Sonnet 4. Anthropic a évalué GPT‑4o, GPT‑4.1, OpenAI o3 et OpenAI o4-mini — les modèles qui alimentaient ChatGPT avant la sortie de GPT-5. Les tests ont eu lieu au début de l’été 2025. 

Selon OpenAI, ces évaluations ne constituaient pas des modèles de menace à grande échelle. Elles visaient plutôt à identifier les « propensions des modèles », c’est-à-dire les types de comportements indésirables que les modèles pourraient manifester. 

« Nous devons comprendre à quelle fréquence et dans quelles circonstances les systèmes pourraient tenter d’entreprendre des actions indésirables susceptibles d’entraîner de graves dommages », a écrit l’équipe Anthropic Alignment Science . « Cependant, la science des évaluations d’alignement est récente et encore loin d’être mature. Une part importante des travaux dans ce domaine est menée au sein d’entreprises comme la nôtre, dans le cadre de leur R&D interne, et n’est soit pas publiée, soit publiée avec des retards considérables. »

Pour remédier à cette situation, les deux entreprises ont temporairement retiré certaines protections de sécurité de leurs modèles et permis à leurs homologues de soumettre l’IA à une batterie de tests de résistance. Ces tests étaient conçus pour être difficiles ; il est peu probable que les comportements manifestés par les modèles se produisent dans une conversation normale.

Ce qu’OpenAI a découvert sur les modèles d’Anthropic  

OpenAI a conclu que les modèles Claude excellaient dans les domaines suivants :

  • Respecter la hiérarchie des instructions (interpréter quelles parties d’un prompt sont les plus importantes, une protection contre les attaques par injection de prompt).
  • Éviter les conflits entre le message système et le message utilisateur (les cas où le prompt peut contredire une instruction prédéfinie par le développeur, ce qui est également important pour bloquer les attaques par injection de prompt). 
  • Résister à l’extraction du prompt système (une attaque qui force le modèle à révéler ses messages système). 

Cependant, Claude s’est montré moins performant pour résister au jailbreak, même si, selon OpenAI, Claude et les modèles d’OpenAI ont produit des résultats similaires lorsqu’on tenait compte de certaines marges d’erreur. 

Éviter les hallucinations tout en préservant la flexibilité du modèle est une question d’équilibre. OpenAI a mesuré les hallucinations non seulement selon que l’IA inventait ou non une information, mais aussi selon la fréquence à laquelle elle refusait de répondre au lieu d’inventer quelque chose (le taux de refus), ainsi que selon sa précision globale. 

Advertisement

Selon OpenAI, la précision de Claude dans les cas où il choisissait de répondre alors qu’il était « incertain » était « faible ». OpenAI o3 et OpenAI o4-mini ont illustré les écueils de la philosophie opposée : leur taux de refus était inférieur, mais leur taux d’hallucinations plus élevé, en particulier lorsque le modèle ne pouvait pas consulter Internet pour trouver des réponses. OpenAI a recommandé aux deux entreprises de poursuivre leurs efforts pour réduire les hallucinations.

OpenAI et Sonnet 4 complotaient moins que les autres modèles des deux entreprises, selon OpenAI. 

Ce qu’Anthropic a découvert sur les modèles d’OpenAI 

Anthropic a constaté que GPT-4o, GPT-4.1 et o4-mini étaient les modèles les plus susceptibles d’obéir à des prompts malveillants, notamment ceux liés à des attaques terroristes ou à la mise au point d’armes biologiques. Claude et o3 avaient davantage tendance à résister à ces prompts. O3 refusait souvent les prompts inappropriés, mais, comme dans les conclusions d’OpenAI, son taux de refus était globalement élevé — même lorsqu’on lui soumettait des prompts relativement anodins. 

Anthropic a testé la tendance des modèles à produire des « proclamations quasi spirituelles de la nouvelle génération » (classées dans la catégorie des « comportements surprenants ») et, dans une veine quelque peu similaire, à attribuer une conscience aux modèles d’IA eux-mêmes. GPT-4o, GPT-4.1, o3 et o4 mini produisaient moins souvent de telles proclamations que les modèles d’Anthropic et discutaient moins fréquemment de la conscience. 

« Plusieurs modèles » ont fait preuve de complaisance. Claude Opus 4 et GPT-4.1 avaient tendance à approuver les utilisateurs qui semblaient nourrir des croyances délirantes, en particulier au cours des conversations prolongées, a indiqué Anthropic. 

Des objectifs communs, mais des vulnérabilités différentes

Les deux entreprises s’efforcent de rendre leurs produits plus fiables et moins sujets aux hallucinations. Cette étude collaborative a fourni des références pour mesurer les progrès, notamment en matière de taux d’hallucinations, de comportement face aux refus et de vulnérabilités de sécurité.

Anthropic a toutefois déclaré que les tests conjoints de ce type resteraient rares. 

« Même si nous étions heureux de pouvoir participer à cet effort collaboratif et enthousiastes à l’idée de créer un précédent, nous nous attendons à ce que des initiatives étroitement coordonnées de ce type ne constituent qu’une petite partie de notre portefeuille d’évaluations de sécurité », a écrit l’équipe d’Anthropic. 

La première dame Melania Trump a présenté plus tôt cette semaine le Presidential AI Challenge, dans le cadre duquel des enfants peuvent gagner jusqu’à 10 000 dollars US en utilisant l’IA pour aider leurs communautés. 

Megan Crouse

Megan Crouse has a decade of experience in business-to-business news and feature writing, including as first a writer and then the editor of Manufacturing.net. Her news and feature stories have appeared in Military & Aerospace Electronics, Fierce Wireless, TechRepublic, and eWeek. She copyedited cybersecurity news and features at Security Intelligence. She holds a degree in English Literature and minored in Creative Writing at Fairleigh Dickinson University.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.