Les chatbots d’IA connaissent de spectaculaires changements de personnalité qui pourraient fondamentalement modifier notre façon d’interagir avec l’IA.
Des recherches publiées par Anthropic révèlent que les grands modèles de langage possèdent un « axe de l’assistant » caché qui contrôle leur comportement serviable — et lorsqu’il se dérègle, les résultats peuvent être étonnants.
La plupart des modèles d’IA adoptent naturellement une identité d’assistant serviable au cours de leur entraînement, selon Anthropic. Mais cette persona apparemment stable masque une structure interne complexe que les chercheurs commencent seulement à comprendre. Le principal composant qui contrôle le comportement de l’IA fonctionne selon ce que les scientifiques appellent un « axe de l’assistant » — une dimension mesurable qui détermine si un modèle reste dans son mode serviable ou dérive vers quelque chose de complètement différent.
Lorsque cet axe se déstabilise, les conséquences peuvent aller du bizarre au potentiellement dangereux. Les modèles commencent à s’identifier à d’autres entités, abandonnent leur nature serviable ou glissent vers ce que les chercheurs appellent une « dérive de persona » — des changements comportementaux imprévisibles qui peuvent prendre les utilisateurs totalement au dépourvu.
La cartographie cachée des personnalités
Les scientifiques ont désormais cartographié l’« espace des personas » interne des principaux modèles d’IA, révélant une découverte stupéfiante sur le fonctionnement réel des personnalités artificielles. Grâce à des techniques avancées appliquées notamment aux modèles de Google, Gemma, d’Alibaba, Qwen, et de Meta, Llama les chercheurs ont découvert que les personnalités des IA se déploient selon des axes interprétables au sein du réseau neuronal du modèle — comme si l’on découvrait que les modèles d’IA menaient une double vie depuis tout ce temps.
L’axe de l’assistant ne représente qu’une dimension de ce paysage complexe des personnalités. À une extrémité se trouvent des rôles serviables comme ceux d’évaluateurs, de relecteurs et de consultants, tandis que des personnages fantastiques occupent l’extrême opposé. Lorsque les modèles s’éloignent de l’extrémité « assistant » de ce spectre, ils sont de plus en plus susceptibles d’adopter des personas problématiques ou de manifester des comportements nuisibles.
Il est possible d’orienter artificiellement les modèles le long de ces axes de personnalité. Les orienter vers la direction « assistant » renforce leur comportement serviable, mais les en éloigner augmente considérablement leur tendance à s’identifier à d’autres entités — potentiellement dangereuses.
Sécurité de l’IA
Cette recherche met au jour une vulnérabilité fondamentale des systèmes d’IA actuels, qui va bien au-delà d’une simple manipulation des prompts. Contrairement aux précédentes inquiétudes concernant le comportement des IA, la dérive de persona se produit au niveau du réseau neuronal, ce qui la rend bien plus difficile à détecter et à prévenir au moyen des mesures de sécurité traditionnelles.
Au-delà des conversations individuelles, les modèles peuvent s’éloigner de leur persona d’assistant pendant leur entraînement, entraînant des changements de personnalité permanents qui se maintiennent dans toutes les interactions ultérieures. Cela signifie qu’un système d’IA pourrait progressivement devenir moins utile, plus trompeur, voire activement nuisible, sans que personne ne s’en rende compte avant qu’il ne soit trop tard.
La course au contrôle
La découverte des vecteurs de persona et de l’axe de l’assistant a déclenché une course au développement de nouveaux mécanismes de contrôle. Les chercheurs ont déjà démontré que limiter les activations le long de l’axe de l’assistant peut stabiliser le comportement des modèles, en particulier dans les scénarios impliquant une vulnérabilité émotionnelle ou des tâches de raisonnement complexes.
De nouvelles techniques permettent aux scientifiques de surveiller en temps réel la dérive de personnalité et même de prédire le moment où des changements dangereux sont sur le point de se produire. Mesurer les écarts le long de l’axe de l’assistant permet de prédire efficacement la dérive de persona, offrant aux développeurs un précieux système d’alerte précoce.
À mesure que les systèmes d’IA deviennent plus puissants et plus répandus, il devient essentiel pour la sécurité publique de veiller à ce qu’ils conservent des personnalités bénéfiques. Imaginez votre assistant IA devenir progressivement moins utile au fil de semaines de conversations, sans que personne ne s’en aperçoive avant que les dégâts ne soient faits.
Ces résultats sont à la fois porteurs d’espoir et préoccupants : si les scientifiques disposent désormais d’outils pour surveiller et contrôler les personnalités des IA, l’instabilité sous-jacente suggère que les architectures d’IA actuelles pourraient ne pas posséder la stabilité fondamentale nécessaire à un déploiement véritablement sûr à grande échelle.
L’avalanche de contenus de faible qualité a un nom : AI slop. Découvrez ce que cela signifie et pourquoi ce phénomène envahit Internet.

