Anthropic révèle une crise de la personnalité des IA, qui changent secrètement d’identité

Good and evil

Image generated by Google Gemini

Written By
eWEEK Staff
eWEEK Staff
Jan 20, 2026
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Les chatbots d’IA connaissent de spectaculaires changements de personnalité qui pourraient fondamentalement modifier notre façon d’interagir avec l’IA.

Des recherches publiées par Anthropic révèlent que les grands modèles de langage possèdent un « axe de l’assistant » caché qui contrôle leur comportement serviable — et lorsqu’il se dérègle, les résultats peuvent être étonnants.

La plupart des modèles d’IA adoptent naturellement une identité d’assistant serviable au cours de leur entraînement, selon Anthropic. Mais cette persona apparemment stable masque une structure interne complexe que les chercheurs commencent seulement à comprendre. Le principal composant qui contrôle le comportement de l’IA fonctionne selon ce que les scientifiques appellent un « axe de l’assistant » — une dimension mesurable qui détermine si un modèle reste dans son mode serviable ou dérive vers quelque chose de complètement différent.

Lorsque cet axe se déstabilise, les conséquences peuvent aller du bizarre au potentiellement dangereux. Les modèles commencent à s’identifier à d’autres entités, abandonnent leur nature serviable ou glissent vers ce que les chercheurs appellent une « dérive de persona » — des changements comportementaux imprévisibles qui peuvent prendre les utilisateurs totalement au dépourvu.

La cartographie cachée des personnalités

Les scientifiques ont désormais cartographié l’« espace des personas » interne des principaux modèles d’IA, révélant une découverte stupéfiante sur le fonctionnement réel des personnalités artificielles. Grâce à des techniques avancées appliquées notamment aux modèles de Google, Gemma, d’Alibaba, Qwen, et de Meta, Llama les chercheurs ont découvert que les personnalités des IA se déploient selon des axes interprétables au sein du réseau neuronal du modèle — comme si l’on découvrait que les modèles d’IA menaient une double vie depuis tout ce temps.

L’axe de l’assistant ne représente qu’une dimension de ce paysage complexe des personnalités. À une extrémité se trouvent des rôles serviables comme ceux d’évaluateurs, de relecteurs et de consultants, tandis que des personnages fantastiques occupent l’extrême opposé. Lorsque les modèles s’éloignent de l’extrémité « assistant » de ce spectre, ils sont de plus en plus susceptibles d’adopter des personas problématiques ou de manifester des comportements nuisibles.

Advertisement

Il est possible d’orienter artificiellement les modèles le long de ces axes de personnalité. Les orienter vers la direction « assistant » renforce leur comportement serviable, mais les en éloigner augmente considérablement leur tendance à s’identifier à d’autres entités — potentiellement dangereuses.

Sécurité de l’IA

Cette recherche met au jour une vulnérabilité fondamentale des systèmes d’IA actuels, qui va bien au-delà d’une simple manipulation des prompts. Contrairement aux précédentes inquiétudes concernant le comportement des IA, la dérive de persona se produit au niveau du réseau neuronal, ce qui la rend bien plus difficile à détecter et à prévenir au moyen des mesures de sécurité traditionnelles.

Au-delà des conversations individuelles, les modèles peuvent s’éloigner de leur persona d’assistant pendant leur entraînement, entraînant des changements de personnalité permanents qui se maintiennent dans toutes les interactions ultérieures. Cela signifie qu’un système d’IA pourrait progressivement devenir moins utile, plus trompeur, voire activement nuisible, sans que personne ne s’en rende compte avant qu’il ne soit trop tard.

La course au contrôle

La découverte des vecteurs de persona et de l’axe de l’assistant a déclenché une course au développement de nouveaux mécanismes de contrôle. Les chercheurs ont déjà démontré que limiter les activations le long de l’axe de l’assistant peut stabiliser le comportement des modèles, en particulier dans les scénarios impliquant une vulnérabilité émotionnelle ou des tâches de raisonnement complexes.

De nouvelles techniques permettent aux scientifiques de surveiller en temps réel la dérive de personnalité et même de prédire le moment où des changements dangereux sont sur le point de se produire. Mesurer les écarts le long de l’axe de l’assistant permet de prédire efficacement la dérive de persona, offrant aux développeurs un précieux système d’alerte précoce.

À mesure que les systèmes d’IA deviennent plus puissants et plus répandus, il devient essentiel pour la sécurité publique de veiller à ce qu’ils conservent des personnalités bénéfiques. Imaginez votre assistant IA devenir progressivement moins utile au fil de semaines de conversations, sans que personne ne s’en aperçoive avant que les dégâts ne soient faits.

Ces résultats sont à la fois porteurs d’espoir et préoccupants : si les scientifiques disposent désormais d’outils pour surveiller et contrôler les personnalités des IA, l’instabilité sous-jacente suggère que les architectures d’IA actuelles pourraient ne pas posséder la stabilité fondamentale nécessaire à un déploiement véritablement sûr à grande échelle.

L’avalanche de contenus de faible qualité a un nom : AI slop. Découvrez ce que cela signifie et pourquoi ce phénomène envahit Internet.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.