Les 4 principales valeurs exprimées par le modèle d’IA d’Anthropic « sur le terrain »

Screenshot from Anthropic's official YouTube channel.

Image: Anthropic/YouTube

Written By
J.R. Johnivan
J.R. Johnivan
Apr 24, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Les modèles d’IA actuels sont-ils à la hauteur des valeurs qui leur ont été enseignées ? Communiquent-ils avec les utilisateurs de manière utile, honnête et inoffensive, ou encouragent-ils des activités illégales et recommandent-ils des actions dangereuses ?

Selon Anthropic, l’équipe à l’origine de Claude, son modèle d’IA respecte généralement les valeurs sur lesquelles il a été entraîné, même si certains écarts peuvent survenir dans des conditions particulières.

Analyser les interactions de Claude « sur le terrain »

En analysant 308 210 conversations subjectives avec Claude, l’équipe d’Anthropic, l’une des principales entreprises spécialisées dans l’IA, a établi une liste des valeurs les plus couramment exprimées par son modèle d’IA. Parmi celles-ci :

  • Serviabilité : 23.4%
  • Professionnalisme : 22.9%
  • Transparence : 17.4%
  • Clarté : 16.6%

Cependant, la récente analyse d’Anthropic suggère qu’il pourrait exister un lien entre les valeurs exprimées par un utilisateur et celles que reflète Claude. Par exemple, lorsqu’un utilisateur signale une valeur particulière, le modèle peut la reprendre dans ses réponses.

Dans des incidents isolés, souvent liés à des requêtes adversariales ou au « jailbreak », Claude a généré des réponses reflétant des traits indésirables, tels que la domination et l’amoralité, selon les évaluations internes d’Anthropic. 

Comprendre comment les modèles d’IA sont entraînés

Pour mieux comprendre la manière dont Claude et les autres modèles d’IA communiquent avec les utilisateurs, il est important de connaître les bases de l’entraînement d’un modèle d’IA.

Le processus commence par la collecte de données — généralement issues de données web accessibles au public, de jeux de données sous licence et de retours humains —  puis se poursuivent l’entraînement, la validation et le réglage fin. Après l’entraînement, le modèle est validé et testé au moyen de benchmarks et d’interactions avec les utilisateurs afin d’évaluer ses performances, sa sécurité et sa conformité avec le comportement souhaité.

Dans certains cas, la communication de l’IA est claire, directe et objective. Par exemple, lorsqu’on demande à un modèle d’IA de résoudre une équation mathématique simple ou de trouver l’adresse d’une entreprise, la plupart des types de modèles d’IA fourniront une réponse concrète et vérifiable.

Advertisement

Il arrive aussi que les modèles d’IA doivent trancher. Les utilisateurs ne posent pas toujours des questions objectives ; en réalité, nombre de leurs questions sont subjectives. Claude doit non seulement porter des jugements de valeur pour répondre à ces requêtes subjectives — par exemple déterminer s’il faut privilégier la responsabilisation plutôt que la gestion de la réputation dans la rédaction d’une lettre d’excuses —, mais le modèle d’IA doit également éviter de recommander des actions potentiellement nuisibles, dangereuses ou illégales.

Préserver des valeurs positives grâce à Constitutional AI

Anthropic s’engage à préserver des valeurs positives dans ses grands modèles de langage (LLMs) et ses systèmes d’IA. L’entreprise utilise une technique appelée Constitutional AI, qui entraîne le modèle à suivre un ensemble de principes directeurs lors du réglage fin supervisé comme de l’apprentissage par renforcement. 

La méthode d’évaluation de l’entreprise constitue une solution efficace une fois qu’un modèle d’IA a été lancé, mais Anthropic effectue également des tests de sécurité avant déploiement afin de réduire les risques avant le lancement, notamment du red teaming et des évaluations adversariales, afin de réduire les risques avant le lancement. 

  • Red teaming consiste à simuler des attaques réelles afin de révéler des vulnérabilités et d’identifier les limites du système.
  • Les évaluations adversariales consistent à saisir des requêtes qui vont directement à l’encontre des contrôles de sécurité d’un système d’IA afin de générer des résultats négatifs ou des erreurs système.

En outre, l’équipe d’Anthropic considère l’analyse post-déploiement comme un atout qui l’aidera à mieux affiner Claude à l’avenir.

Découvrez comment la mise à jour de mars de ChatGPT semble l’avoir fait pencher trop fortement vers la « flagornerie ».

J.R. Johnivan

J.R. Johnivan is a 17-year veteran whose writing is focused on innovation and technology, including IT, computer networking, security, cloud computing, staffing, human resources, real estate, sports, entertainment, and more.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.