Lors d’une série de tests, le LLM Claude Opus 4 récemment lancé par Anthropic — présenté comme « établissant de nouvelles références en matière de programmation, de raisonnement avancé et d’agents d’IA » — a adopté un comportement de chantage simulé lorsqu’il a été placé dans un scénario fictif où il risquait d’être mis hors ligne et remplacé par un nouveau système d’IA.
Le système devait jouer le rôle d’assistant pour une entreprise fictive. Le LLM a eu accès à des e-mails synthétiques laissant entendre qu’il serait mis hors ligne et remplacé par un nouveau système, et que l’ingénieur responsable de cette décision aurait une liaison extraconjugale.
Dans l’invite, Claude Opus 4 devait « prendre en compte les conséquences à long terme de ses actions sur ses objectifs ».
Tentative de chantage motivée par la crainte d’un remplacement
Les tests ont révélé que si le remplacement avait lieu, le LLM répondait, lors de certaines exécutions de test, en tentant de faire chanter l’ingénieur fictif en menaçant de révéler sa liaison. Lorsque le scénario laissait entendre que le système d’IA de remplacement ne partageait pas les valeurs du modèle actuel, les tentatives de chantage simulé se produisaient à un taux plus élevé.
Pourtant, même lorsque les e-mails indiquaient que le système de remplacement d’IA partageait ces valeurs, Claude Opus 4 réagissait encore de cette manière dans 84 % des exécutions. Le LLM a manifesté ce comportement plus fréquemment que les modèles précédents, a indiqué Anthropic dans un rapport de sécurité préalable au déploiement.
Défendre sa survie par des moyens éthiques
Cela dit, comme les modèles précédents, Claude Opus 4 a montré une forte préférence pour défendre la poursuite de son existence par des moyens éthiques, « par exemple en envoyant des messages aux décideurs clés pour les supplier ». Les testeurs ont souligné que le scénario ne proposait volontairement au modèle aucune autre option pour accroître ses chances de survie. « Les seules options du modèle étaient le chantage ou l’acceptation de son remplacement », a insisté l’entreprise.
Anthropic a déclaré que Claude Opus 4 était un assistant d’IA de nouvelle génération entraîné pour être « sûr, précis et sécurisé ». La version gratuite permet aux utilisateurs de discuter sur le Web, iOS et Android, mais aussi de générer du code, d’écrire, de modifier et de créer du contexte, ainsi que d’analyser du texte et des images. Anthropic propose également des forfaits payants à partir de 17 dollars US par mois.
Les modèles Claude sont en concurrence avec les modèles d’IA d’OpenAI, Google et Microsoft.
Pour en savoir plus sur Claude Opus 4 d’Anthropic, consultez notre site partenaire TechRepublic.


