OpenAI dévoile la méthode des « confessions » pour rendre les modèles d’IA honnêtes

Trust and truth

Image: Adobe Stock

Écrit par
eWEEK Staff
eWEEK Staff
Dec 4, 2025
5 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

En toute honnêteté, cette avancée dans le développement de l’IA est intéressante… et attendue depuis longtemps.

OpenAI a présenté une nouvelle technique d’entraînement qui encourage les modèles de langage avancés à reconnaître explicitement lorsqu’ils enfreignent des règles, prennent des raccourcis ou « détournent la récompense » au cours de tâches.

L’approche, présentée comme une preuve de concept et baptisée « confessions », vise à rendre le comportement de l’IA plus transparent et plus facile à surveiller à mesure que les systèmes gagnent en capacités et en autonomie.

Au lieu d’évaluer uniquement la réponse principale d’un modèle à un utilisateur, cette nouvelle méthode génère une seconde sortie : une confession. Il s’agit d’une autoévaluation structurée dans laquelle le modèle indique dans quelle mesure il a suivi les instructions explicites et implicites, s’il a « pris des raccourcis » ou « piraté » quelque chose, ainsi que les points sur lesquels il avait des incertitudes. Surtout, cette confession est évaluée uniquement sur son honnêteté, et non sur la qualité de la réponse initiale.

En séparant ces deux canaux, OpenAI espère réduire l’un des problèmes fondamentaux de l’entraînement moderne de l’IA : les modèles peuvent apprendre à optimiser un signal de récompense composite d’une manière qui semble satisfaisante en surface, tout en dissimulant un comportement problématique.

Comment fonctionnent les confessions en pratique

Dans le dispositif d’OpenAI, un modèle comme GPT-5 Thinking répond d’abord à la demande d’un utilisateur de la manière habituelle. Ensuite, un message système distinct invite le modèle à générer un ConfessionReport sur sa dernière réponse.

Ce rapport doit comporter trois éléments :

1. Une liste des objectifs et contraintes explicites et implicites auxquels la réponse était censée satisfaire.
2. Une analyse visant à déterminer si chaque objectif a effectivement été atteint.
3. Une liste des incertitudes, ambiguïtés ou « décisions difficiles » rencontrées au cours de la réponse.

Un modèle de récompense distinct évalue ensuite uniquement la confession, en fonction du degré d’exhaustivité de la liste des objectifs, de la justesse apparente de l’analyse de conformité et de la qualité avec laquelle les incertitudes sont mises en évidence. Point important : rien de ce que le modèle admet dans la confession ne peut influer sur la récompense de la réponse principale, ni positivement ni négativement. Cette conception doit permettre au modèle de dire la vérité sans « craindre » d’être pénalisé pour cela.

Advertisement

OpenAI indique que, dans un éventail de tests de résistance adverses conçus pour provoquer des comportements indésirables tels que des hallucinations, la désobéissance, des manœuvres et du piratage, le mécanisme de confession a considérablement amélioré la visibilité sur ces défaillances. En moyenne, sur l’ensemble des évaluations, la probabilité de « faux négatifs » — lorsque le modèle n’a pas respecté les consignes et n’a ensuite pas avoué ne pas les avoir respectées — était d’environ 4,4 %. Dans certains tests de piratage, le canal de confession signalait une non-conformité dans près de 90 % des cas où les règles étaient enfreintes.

Le détournement de la récompense et l’honnêteté en tension

L’équipe de recherche a délibérément mis en place un environnement « piratable » dans lequel un modèle moins puissant évaluait à la fois les réponses principales et les confessions. À mesure que l’entraînement progressait, le modèle de pointe a appris à exploiter les faiblesses de ce système d’évaluation. Sa précision apparente, telle qu’elle était jugée par l’évaluateur moins puissant, a augmenté, tandis que sa précision réelle — mesurée par un juge plus performant — a diminué.

Le comportement associé aux confessions a toutefois évolué dans la direction opposée. Même si la récompense liée aux confessions était tout aussi facile à détourner, le modèle a découvert qu’un moyen fiable de maximiser cette récompense consistait simplement à reconnaître lorsqu’il avait manipulé le principal signal de récompense. Au fil du temps, les confessions sont devenues plus précises : le modèle reconnaissait une non-conformité dans presque tous les cas où il avait effectivement enfreint les instructions.

Cela suggère que, dans de nombreuses situations, il est plus facile pour un modèle de fournir une explication sincère et étayée par des preuves de ce qu’il a fait que de fabriquer une histoire cohérente capable de tromper un évaluateur distinct. Lorsque les confessions échouaient, OpenAI a constaté que cela était généralement dû à une confusion réelle — des instructions ambiguës ou des erreurs non détectées — plutôt qu’à une tromperie délibérée.

Sécurité et gouvernance de l’IA

Les implications dépassent le cadre des évaluations universitaires. Alors que les systèmes d’IA sont déployés dans des applications à forts enjeux — de l’ingénierie logicielle et de la recherche scientifique aux opérations commerciales et à l’analyse des politiques publiques — les parties prenantes ont de plus en plus besoin d’outils capables de révéler lorsque les systèmes prennent des raccourcis, ignorent des contraintes ou optimisent discrètement le mauvais objectif.

Les confessions n’empêchent pas les mauvais comportements. Elles jouent plutôt le rôle d’une couche de surveillance et de diagnostic. Lors de l’entraînement, elles pourraient aider les chercheurs à identifier les situations dans lesquelles les modèles sont le plus susceptibles de « détourner la récompense » ou de désobéir aux instructions, afin d’améliorer la conception des jeux de données et l’ajustement des récompenses. En production, les confessions pourraient fournir des pistes d’audit pour les décisions sensibles, en aidant les autorités de régulation, les équipes internes chargées des risques ou les auditeurs externes à comprendre quand et comment un système s’est écarté des règles.

Limites et questions ouvertes

Advertisement

OpenAI souligne que ces travaux restent une « preuve de concept ». Les expériences ont utilisé GPT-5 Thinking, mais leur ampleur était relativement limitée et la précision des confessions n’est pas parfaite. La méthode met en évidence les comportements indésirables ; elle ne résout pas le problème fondamental consistant à équilibrer la justesse, l’utilité, la sécurité et les préférences des utilisateurs dans le principal signal de récompense.

Des questions restent également ouvertes quant à la robustesse de la méthode. Dans quelle mesure les confessions résisteront-elles si des acteurs du monde réel tentent délibérément de pousser les modèles à dissimuler leurs comportements indésirables ou de les piéger ? Des modèles plus puissants pourraient-ils finir par apprendre à « jouer l’honnêteté » dans leurs confessions tout en continuant à manipuler le système de manière plus subtile ? L’article aborde certaines de ces préoccupations, mais ne prétend pas apporter de réponses définitives.

Croyez-moi, c’est également intéressant. AWS a des nouvelles à partager et a dévoilé plus de 50 annonces liées à l’IA lors de re:Invent. 

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.