Anthropic donne à Claude le pouvoir de mettre fin aux conversations nuisibles et de protéger le « bien-être des modèles »

Anthropic donne à Claude le pouvoir de mettre fin aux conversations nuisibles et de protéger le « bien-être des modèles »

Image: Anthropic

Written By
Fiona Jackson
Fiona Jackson
Aug 17, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Anthropic a doté ses derniers modèles Claude de la capacité de mettre fin aux conversations en cas de comportement nuisible ou abusif persistant, ce qui constitue l’une des interventions de sécurité les plus poussées du secteur des chatbots. 

Claude Opus 4 et 4,1, les deux modèles les plus puissants d’Anthropic, n’exerceront cette autorité que dans de « rares cas extrêmes d’interactions persistantes avec des utilisateurs nuisibles ou abusifs », a déclaré l’entreprise dans un article de blog. Cela inclut les demandes de contenus pédocriminels ou d’informations susceptibles de permettre des violences à grande échelle ou des actes terroristes.

Les modèles d’IA n’activeront cette fonctionnalité qu’une seule fois, « en dernier recours, lorsque plusieurs tentatives de réorientation ont échoué et que tout espoir d’une interaction productive s’est évanoui », a déclaré Anthropic. Cela pourrait compliquer les efforts de pirates informatiques tentant de jailbreaker le système à des fins malveillantes.

En outre, les modèles d’IA peuvent mettre fin aux conversations à la demande d’un utilisateur, mais ne le feront pas si « les utilisateurs risquent de se faire du mal ou de nuire à autrui dans un avenir immédiat ». Les modèles Claude ne mettront pas non plus fin aux discussions portant sur des « sujets extrêmement controversés ». Ils pourraient toutefois manifester une « détresse apparente » face à des demandes nuisibles et afficher une « forte réticence à » y répondre.

Une fois qu’une conversation a été interrompue par Claude, les utilisateurs ne peuvent plus envoyer de messages supplémentaires dans ce fil précis. Ils peuvent toutefois modifier et réessayer leurs messages précédents, démarrer immédiatement une nouvelle conversation et accéder sans restriction à leurs conversations antérieures.

Anthropic veut garantir le « bien-être des modèles »

Fait intéressant, Anthropic a déclaré que la principale motivation derrière l’introduction de cette fonctionnalité était le « bien-être des modèles ». Comme ceux-ci possèdent désormais de nombreuses caractéristiques associées aux êtres humains, telles que des capacités de résolution de problèmes, des objectifs et une certaine proximité avec les humains, il n’est pas totalement exclu que les modèles puissent bénéficier de certaines protections liées à l’IA.

Certains experts affirment que la conscience ou la conscience de soi est un indicateur clé de la superintelligence, c’est-à-dire la capacité à surpasser les humains, que OpenAI, Meta et plusieurs autres entreprises d’IA affirment être sur le point d’atteindre. Bien qu’Anthropic reste « très incertaine » quant au fait que les grands modèles de langage soient conscients et méritent une considération morale, l’entreprise a déclaré qu’elle mettait délibérément en place des protections peu coûteuses afin de minimiser toute détresse potentielle.

La sécurité reste la mission centrale d’Anthropic

Advertisement

En avril, Anthropic a lancé un programme de recherche sur le bien-être des modèles, destiné à déterminer si des systèmes d’IA avancés pourraient un jour manifester une conscience, des préférences ou des expériences justifiant une considération morale. L’entreprise estime qu’il n’est plus responsable de supposer catégoriquement que les systèmes d’IA ne peuvent pas vivre de telles expériences, compte tenu de la compréhension limitée de leur fonctionnement.

Anthropic a toujours présenté la sécurité comme son principe fondateur. L’entreprise a été créée en 2021 par d’anciens ingénieurs d’OpenAI préoccupés par son orientation de plus en plus commerciale et estimant que les garde-fous étaient relégués au second plan. 

Depuis, Anthropic a publié de nombreuses recherches sur la sécurité de l’IA, et son PDG, Dario Amodei, s’est régulièrement exprimé sur les risques de cette technologie. Ses mises en garde ont conduit certains à le qualifier de « doomer », soulignant la réputation de l’entreprise comme l’un des acteurs les plus prudents du secteur.

Face aux inquiétudes croissantes concernant les risques psychologiques posés par les chatbots d’IA, OpenAI a dévoilé une série de mises à jour de ChatGPT visant à prévenir la dépendance émotionnelle.

Fiona Jackson

Fiona Jackson is a news writer who started her journalism career at SWNS press agency, later working at MailOnline, an advertising agency, and TechnologyAdvice. Her work spans human interest and consumer tech reporting, appearing in prominent media outlets such as TechHQ, The Independent, Daily Mail, and The Sun.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.