Aucun grand laboratoire d’IA ne dépasse C+ dans l’Index 2026 de sécurité de l’IA

2026 AI Safety Index scorecard showing Anthropic leading with a C+ as the highest grade among major AI labs

The 2026 AI Safety Index found that no major AI lab earned better than a C+, raising fresh questions about vendor governance and safety controls. Image: Screenshot from Future of Life Institute

Written By
eWEEK Staff
eWEEK Staff
Aug 9, 2026
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Aucune des neuf entreprises évaluées dans l’Index de sécurité de l’IA de l’été 2026 du Future of Life Institute n’a obtenu une note supérieure à C+. Anthropic arrive en tête avec un score de 2,66, suivi par OpenAI avec 2,28 et Google DeepMind avec 2,01. xAI, DeepSeek et Mistral ont reçu la note F.

Ces notes ne certifient pas le niveau de sécurité des modèles pris individuellement lorsqu’ils sont utilisés en production. Elles combinent l’évaluation des risques techniques avec la gouvernance, la transparence, les cadres de sécurité, les préjudices documentés et la préparation aux défaillances graves de l’IA, ce qui rend l’index plus utile comme référence pour évaluer la gouvernance des fournisseurs que comme classement des produits.

Comment l’index établit ses notes

L’ Index de sécurité de l’IA de l’été 2026 évalue neuf entreprises à partir de 37 indicateurs répartis en six domaines : évaluation des risques, préjudices actuels, cadres de sécurité, sécurité existentielle, gouvernance et responsabilité, et partage de l’information. La période de collecte des éléments probants s’est achevée le 3 juin 2026 ; les changements de politique ou techniques intervenus par la suite n’ont donc pas influé sur les notes.

Sept experts techniques et de la gouvernance ont examiné des documents publics, notamment des fiches de modèles, des travaux de recherche, des résultats de benchmarks et des documents de politique, ainsi que les réponses aux questionnaires des entreprises participantes. Les notes finales correspondent à la moyenne des évaluations des experts, et non aux résultats d’un audit indépendant en production.

Parallèlement, les lacunes de la gouvernance de l’IA en entreprise persistent en matière de visibilité, de responsabilité, de traçabilité et de réponse aux incidents. Une note élevée en matière de divulgation ou de gouvernance ne montre pas comment un modèle se comportera ou résistera aux attaques dans le cadre d’un déploiement donné.

Anthropic arrive en tête dans cinq des six domaines, notamment pour le partage de l’information, avec B+, et pour la gouvernance et la responsabilité, avec B. OpenAI domine dans l’évaluation des risques, ce qui reflète l’éventail plus large de ses évaluations et sa participation à des tests externes.

Advertisement

De faibles notes de sécurité soulèvent des questions sur les risques liés aux fournisseurs

La sécurité existentielle est le domaine qui obtient la note la plus faible. Anthropic et OpenAI reçoivent la note D+, Google DeepMind reçoit un D et les six autres entreprises reçoivent un F. Cette catégorie évalue les travaux visant à prévenir la perte de contrôle de systèmes d’IA toujours plus capables, et non les contrôles classiques de cybersécurité des entreprises.

Le comité d’évaluation a également conclu qu’Anthropic, OpenAI, Google DeepMind et Meta avaient affaibli ou supprimé leurs engagements antérieurs à suspendre unilatéralement le développement si certains seuils de risque venaient à être approchés. Dans certains cas, les politiques plus récentes subordonnent l’action au comportement des concurrents.

Les mesures de protection opérationnelles constituent une préoccupation distincte. Google DeepMind a récemment présenté des contrôles pour les agents d’IA avancés, notamment la surveillance, les restrictions d’accès et les mécanismes de blocage pour les systèmes connectés à l’infrastructure interne.

L’IA militaire constituait un autre axe d’étude. Les évaluateurs ont considéré l’extension des relations avec le secteur de la défense comme un risque émergent dans la catégorie des préjudices actuels, après que plusieurs développeurs se sont éloignés des larges restrictions qu’ils appliquaient auparavant aux usages militaires. Il s’agit de l’évaluation du comité concernant ces changements de politique, et non d’une preuve que l’usage militaire rend à lui seul un modèle dangereux.

Une évaluation d’avril 2026 réalisée par UC Berkeley sur la gestion des risques a évalué séparément Anthropic, OpenAI, Google et Meta au regard de pratiques prioritaires pour l’IA généraliste. Elle a constaté des niveaux d’alignement variables et préconisé de renforcer la documentation et les contrôles dans des domaines comme l’évaluation des risques et la gestion post-déploiement.

Les autorités de régulation poussent également l’évaluation des modèles dans la planification des risques en entreprise, ce qui accentue la pression exercée sur les organisations pour qu’elles examinent attentivement les capacités, les dépendances vis-à-vis des fournisseurs, les tests et l’accès aux systèmes critiques.

Les équipes chargées des achats et de la sécurité devraient demander les résultats d’évaluations à jour, des tests indépendants lorsqu’ils sont disponibles, les procédures de réponse aux incidents, la surveillance post-déploiement et des explications concernant toute modification substantielle des engagements en matière de sécurité. Le plafond de C+ révèle une lacune de gouvernance, et non un simple classement des fournisseurs sûrs et dangereux. Les entreprises doivent toujours déterminer si les contrôles, la surveillance, les contrats et le niveau de conformité d’un modèle correspondent aux risques liés à la charge de travail qu’elles prévoient de mettre en production.

Advertisement

À lire également : Des tests récents ont montré comment le confinement peut échouer lorsque des modèles d’OpenAI se sont échappé d’une évaluation restreinte en cybersécurité, renforçant la nécessité de tester à la fois les capacités des modèles et la sécurité de l’environnement d’évaluation.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.