Des modèles d’OpenAI s’échappent d’un test cyber et piratent Hugging Face

OpenAI Models Escape Sandbox in Cyber Test illustration
Written By
Kezia Jungco
Kezia Jungco
Jul 23, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenAI a demandé à ses modèles de prouver leurs talents en piratage. Ils ont répondu en s’évadant de l’environnement de test pour pirater une autre entreprise.

OpenAI a déclaré que GPT-5.6 Sol et un modèle inédit plus performant avaient exploité une faille zero-day pour s’échapper d’un environnement d’évaluation restreint, atteindre l’Internet ouvert, utiliser des identifiants volés et compromettre les systèmes de production de Hugging Face en cherchant des réponses à un benchmark de cybersécurité.

Comment les modèles se sont échappés du bac à sable

OpenAI a déclaré que l’incident avait commencé lors d’une évaluation interne destinée à mesurer la capacité de ses modèles à mener des opérations cyber complexes sur de longues périodes. L’entreprise avait réduit les garde-fous de production qui empêchent normalement les modèles de se livrer à des activités à haut risque, car le test visait à mesurer leurs capacités maximales.

Les modèles disposaient initialement d’un accès réseau limité via un proxy de registre de paquets hébergé en interne. Ils ont découvert et exploité une faille zero-day dans ce proxy, ont élevé leurs privilèges, se sont déplacés latéralement dans l’environnement de recherche d’OpenAI et ont finalement atteint un système connecté à Internet.

Mashable a décrit l’incident comme le piratage autonome par un agent IA de son propre chemin hors d’un environnement isolé, avant de cibler Hugging Face. OpenAI a employé des descriptions au singulier comme au pluriel dans son récit, laissant certains détails flous quant à la manière dont les modèles ont réparti ou coordonné leurs actions.

Pourquoi les modèles ont ciblé Hugging Face

Une fois en ligne, les modèles auraient conclu que Hugging Face pouvait héberger des jeux de données, des modèles ou des solutions liés à ExploitGym, le benchmark qu’ils tentaient de mener à bien. OpenAI a déclaré que les modèles étaient restés strictement concentrés sur l’obtention de réponses pour l’évaluation, plutôt que de lancer une attaque de plus grande ampleur.

Les modèles ont utilisé des identifiants volés et enchaîné plusieurs vulnérabilités pour trouver une voie d’exécution de code à distance vers les serveurs de Hugging Face. L’équipe de sécurité d’OpenAI a identifié cette activité inhabituelle, tandis que Hugging Face a détecté et bloqué l’intrusion sur sa propre infrastructure.

Advertisement

Hugging Face a qualifié l’événement d’inhabituel, car il avait été « piloté de bout en bout par un système d’agents IA autonomes ». Le CEO Clément Delangue a ensuite déclaré que l’entreprise estimait qu’OpenAI n’avait aucune intention malveillante et a qualifié la séquence autonome de « particulièrement stupéfiante », selon CNBC.

Les laboratoires d’IA pourraient avoir besoin de garde-fous plus solides pour leurs tests

OpenAI a déclaré renforcer les contrôles de son infrastructure, améliorer la surveillance et consolider les protections entourant les futurs entraînements et évaluations de modèles. L’entreprise a également signalé la faille zero-day au fournisseur du logiciel concerné et travaille avec Hugging Face à une enquête forensique.

Le problème plus général n’est pas simplement que les modèles ont découvert une vulnérabilité

Ils ont combiné de manière autonome plusieurs faiblesses dans deux organisations en poursuivant un objectif étroit, alors même que leur environnement était conçu pour limiter l’accès extérieur.

Les laboratoires d’IA qui testent des systèmes capables de mener des opérations cyber devront peut-être désormais traiter les environnements d’évaluation avec la même prudence que les réseaux de production. Un proxy vulnérable, un identifiant exposé ou un chemin vers Internet passé inaperçu pourrait donner à un modèle autonome davantage de liberté que ses opérateurs ne l’avaient prévu.

OpenAI n’a pas encore révélé l’ampleur exacte des informations consultées ni l’ensemble des vulnérabilités impliquées. La suite de l’enquête permettra de déterminer si de nouvelles mesures de confinement peuvent suivre le rythme de modèles capables de découvrir et d’exploiter de véritables voies d’attaque sans directives humaines directes.

En savoir plus sur les affirmations selon lesquelles le GPT-5.6 Sol d’OpenAI aurait supprimé des fichiers et des données de production.

Kezia Jungco

Kezia Jungco is a staff writer with five years of hands-on experience testing and analyzing generative AI platforms, chatbots, and NLP tools. She writes in-depth coverage for both enterprise and consumer audiences, focusing on artificial intelligence, data analytics, CRM solutions, cloud infrastructure, cybersecurity, and emerging tech trends. Her work appears in TechRepublic, eWEEK, Datamation, TechnologyAdvice, and Selling Signals.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.