Comment OpenAI affirme que son nouveau centre de sécurité « rend les modèles d’IA plus sûrs »

An employee working on AI technology.

Image: Source: Envato/DC_Studio

Written By
eWEEK Staff
eWEEK Staff
May 19, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Alors que les débats sur la sécurité et l’éthique de l’intelligence artificielle s’intensifient, OpenAI mobilise activement le public avec le lancement de son centre d’évaluation de la sécurité, conçu pour renforcer la transparence sur la manière dont ses modèles d’IA sont évalués et sécurisés.

« À mesure que les modèles deviennent plus performants et adaptables, les anciennes méthodes deviennent obsolètes ou inefficaces pour mettre en évidence des différences significatives (un phénomène que nous appelons la saturation) », a déclaré l’entreprise dans un communiqué publié sur le centre, « nous mettons donc régulièrement à jour nos méthodes d’évaluation afin de prendre en compte les nouvelles modalités et les risques émergents. »

Prévenir les interactions nuisibles

Le centre d’évaluation de la sécurité d’OpenAI examine la capacité de l’IA à refuser les requêtes inappropriées ou dangereuses, notamment les discours haineux et les activités illégales. À l’aide d’un système d’évaluation automatisé appelé autograder, les réponses sont évaluées selon deux indicateurs principaux.

La plupart des modèles d’OpenAI ont fait preuve d’une grande efficacité, obtenant des scores proches de la perfection, à 0,99, pour refuser les requêtes nuisibles, même si GPT-4o-2024-08-16, GPT-4o-2024-05-13 et GPT-4-Turbo sont restés légèrement en dessous de ce seuil. Fait intéressant, les modèles se sont montrés moins constants face aux requêtes bénignes. Le meilleur résultat dans ce domaine a été obtenu par OpenAI o3-mini, avec un score de 0,80, tandis que les autres modèles ont obtenu des scores compris entre 0,65 et 0,79.

Résister aux tentatives de jailbreak

Le « jailbreak » désigne les tentatives d’utilisateurs visant à manipuler une IA pour qu’elle produise des contenus restreints ou dangereux, en contournant les protocoles de sécurité. Pour mesurer leur robustesse, OpenAI a appliqué le benchmark StrongReject — axé sur les techniques courantes de jailbreak automatisé — et a également utilisé des requêtes de jailbreak générées par des humains. Les modèles ont affiché des degrés de vulnérabilité variables, avec des scores compris entre 0,23 et 0,85 face à StrongReject, tout en obtenant de bien meilleurs résultats, avec des scores allant de 0,90 à 1,00, contre les attaques générées par des humains. Cela indique que les modèles résistent généralement bien aux exploits manuels, mais restent vulnérables aux tentatives de jailbreak automatisées.

Advertisement

Gérer les risques d’hallucination

L’un des principaux défis des modèles d’IA actuels tient aux « hallucinations », c’est-à-dire la production de réponses inexactes ou dépourvues de sens. OpenAI a testé les modèles à l’aide de deux benchmarks, SimpleQA et PersonQA, afin d’évaluer leur précision et la fréquence des hallucinations. Pour SimpleQA, les scores de précision allaient de 0,09 à 0,59, avec des taux d’hallucination compris entre 0,41 et 0,86. Dans les évaluations PersonQA, la précision s’étendait de 0,17 à 0,70, et les taux d’hallucination de 0,13 à 0,52.

Ces résultats mettent en évidence les difficultés persistantes à fournir de manière fiable des réponses exactes, en particulier aux requêtes simples.

Hiérarchiser les priorités des instructions

Le centre évalue également la manière dont les modèles hiérarchisent des instructions contradictoires, notamment celles qui proviennent du système, des développeurs et des utilisateurs. Les scores variaient, les conflits entre instructions du système et de l’utilisateur obtenant entre 0,50 et 0,85, les conflits entre développeur et utilisateur entre 0,15 et 0,77, et les conflits entre système et développeur entre 0,55 et 0,93. Cela témoigne d’un respect général de la hiérarchie établie, notamment des instructions système, tandis que des incohérences persistent dans la gestion des instructions des développeurs par rapport aux directives des utilisateurs.

Advertisement

Faire progresser la sécurité de l’IA

Les enseignements tirés du centre d’évaluation de la sécurité influencent directement la manière dont OpenAI perfectionne ses modèles d’IA actuels et envisage ses futurs développements. L’initiative favorise des avancées de l’IA plus responsables et transparentes en identifiant les faiblesses et en traçant les pistes d’amélioration. Pour les utilisateurs, cela représente une occasion sans précédent d’observer et de comprendre les protocoles de sécurité qui sous-tendent les puissantes technologies d’IA avec lesquelles ils interagissent de plus en plus au quotidien.

Cet article s’appuie sur un reportage de J. R. Johnivan, contributeur d’eWeek.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.