Cette recherche d’OpenAI pourrait réduire les « manœuvres clandestines » de l’IA

A laptop running an AI software used by IT staff.

Image: DC_Studio/Envato

Written By
Megan Crouse
Megan Crouse
Sep 18, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Les « manœuvres clandestines » de l’IA peuvent s’avérer problématiques lorsqu’on travaille avec l’intelligence artificielle générative. L’IA peut suivre un prompt à la lettre tout en prenant des raccourcis en coulisses. 

Le 17 septembre, OpenAI a publié un billet de blog annonçant avoir mis au point, avec Apollo Research, une méthode appelée alignement délibératif pour réduire les manœuvres clandestines dans deux de ses modèles d’IA.  

« Nous observons aujourd’hui des signes indiquant que ce problème commence à apparaître dans tous les modèles de pointe », ont écrit les chercheurs.

Que sont les manœuvres clandestines de l’IA ? 

L’IA générative peut délibérément dissimuler ou déformer des informations pertinentes pour une tâche, ou parvenir à une conclusion qui correspond au sens littéral d’un prompt, mais pas à son objectif réel. La dissimulation de l’IA entraîne généralement des problèmes limités, comme lorsque ChatGPT fait semblant d’accomplir une tâche qui dépasse en réalité ses capacités. 

« Toutefois, à mesure que les IA se voient confier des tâches plus complexes, aux conséquences bien réelles, et qu’elles commencent à poursuivre des objectifs plus ambigus et à long terme, nous nous attendons à ce que le risque de manœuvres clandestines nuisibles augmente — nos garde-fous et notre capacité à effectuer des tests rigoureux doivent donc progresser en conséquence », ont écrit les chercheurs d’OpenAI

Ironiquement, les tests visant à empêcher les manœuvres clandestines pourraient en réalité les renforcer, ont fait remarquer les chercheurs. 

« Les mesures d’atténuation qui réduisent les manœuvres clandestines peuvent soit (a) réellement les éliminer, soit (b) simplement apprendre au modèle à mieux les dissimuler », ont-ils précisé. « De l’extérieur, les deux résultats sont identiques : la raison du changement de comportement est donc déterminante. »

Dans le cadre d’une évaluation menée avec Apollo Research, OpenAI a créé :                    

  • une méthode d’apprentissage pour réduire les manœuvres clandestines. 
  • un protocole pour tester sous contrainte les futures versions de ces méthodes. 
  • des projets visant à poursuivre les recherches avec Apollo, à mieux faire connaître le problème et à consacrer davantage de ressources de l’équipe aux recherches sur les manœuvres clandestines.

OpenAI a trouvé des cas où l’IA entreprenait des actions dissimulées, comme la rétention ou la déformation d’informations, dans OpenAI o3 et o4-mini, Gemini-2.5-pro et Claude Opus-4. (L’enquête a été menée avant la disponibilité de GPT-5.) 

Advertisement

L’entraînement réalisé à partir des résultats de l’évaluation a réduit les occurrences de manœuvres clandestines dans OpenAI o4-mini, de 8,7 % à 0,3 %. Dans OpenAI o3, elles sont passées de 13 % à 0,4 %. 

Des défis persistants

Un autre facteur permettant de réduire les processus cachés de l’IA est la transparence du raisonnement, c’est-à-dire la difficulté à apprendre à une IA générative à expliquer fidèlement ses propres processus de réflexion. Comme l’a souligné OpenAI, la transparence du raisonnement fait toujours l’objet de recherches chez des géants de l’IA comme Anthropic. 

En juin, Google a supprimé une vue qui permettait aux développeurs de suivre le raisonnement dans Google AI Studio. OpenAI o1, le premier modèle de raisonnement de l’entreprise, n’a lui aussi pas réussi à afficher sa chaîne de pensée. 

Les vulnérabilités liées à la transparence du raisonnement peuvent être soumises au Red-Teaming Challenge d’OpenAI pour gpt-oss-20b. 

OpenAI a mis ChatGPT à jour pour répondre aux dangers auxquels sont exposés les adolescents

Megan Crouse

Megan Crouse has a decade of experience in business-to-business news and feature writing, including as first a writer and then the editor of Manufacturing.net. Her news and feature stories have appeared in Military & Aerospace Electronics, Fierce Wireless, TechRepublic, and eWeek. She copyedited cybersecurity news and features at Security Intelligence. She holds a degree in English Literature and minored in Creative Writing at Fairleigh Dickinson University.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.