Des chercheurs suppriment en quelques minutes les garde-fous des modèles de Google et de Meta

Des chercheurs suppriment en quelques minutes les garde-fous des modèles de Google et de Meta

Image: DC_Studio/Envato Elements

Écrit par
David Curry
David Curry
May 26, 2026
3 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Des chercheurs sont parvenus à contourner en quelques minutes les garde-fous de modèles d’IA open source à l’aide d’outils spécialement conçus pour supprimer les protections de sécurité.

Il a été démontré que le modèle à poids ouverts Gemma 3 de Google et le modèle Llama 3.3 de Meta pouvaient tous deux être facilement détournés : ils répondaient à des requêtes portant sur la création d’une arme biologique, la conception de logiciels malveillants destinés à voler des données de cartes bancaires et la rédaction d’histoires décrivant des abus sexuels sur des enfants.

Des chercheurs du groupe de sécurité de l’IA Alice et du Financial Times ont publié une étude montrant que les modèles open source peuvent être facilement manipulés par des acteurs malveillants. L’équipe de recherche a utilisé un outil appelé Heretic, qui affirme pouvoir « décensurer » les modèles et supprimer leurs garde-fous. 

L’outil est disponible sur GitHub et son créateur affirme qu’il fonctionne sur plus de 3 500 modèles.

L’open source n’est pas aussi sûr qu’on le pensait

Alors que les géants américains de la tech s’éloignent des modèles open source — Meta ayant récemment mis de côté ses projets de publication en open source de ses derniers modèles et Google conservant Gemini comme produit propriétaire —, de nombreux modèles open source continuent d’être publiés. 

Les principaux concepteurs chinois de modèles d’IA, DeepSeek, Alibaba et Baidu, publient tous des modèles open source, tandis que le gouvernement chinois déploie des efforts concertés pour garantir que ces modèles restent open source.

Les deux principaux laboratoires de recherche en IA, OpenAI et Anthropic, ont tous deux conservé leurs modèles d’IA propriétaires. Aucun des deux n’a participé à l’étude du FT pour cette raison : le code sous-jacent, les poids et les garde-fous ne sont pas connus en dehors de l’entreprise. 

Cela dit, aucun des deux n’est infaillible : des recherches ont montré que des utilisateurs à l’aise avec la technologie et des acteurs malveillants ont réussi à manipuler Claude et GPT pour leur faire répondre à des requêtes interdites. OpenAI a également récemment fait l’objet d’une action en justice concernant des garde-fous prétendument assouplis autour de l’automutilation, ce qui a conduit au suicide d’un adolescent. 

Advertisement

Un ralentissement du rythme des lancements

La sophistication croissante de ces modèles d’IA a conduit certains membres de l’administration Trump à envisager une évaluation préalable des modèles d’IA avant leur lancement. 

La Maison-Blanche et d’autres acteurs auraient été surpris par les capacités cyber de Mythos, le modèle d’Anthropic, la National Security Agency aurait utilisé le modèle, en violation de l’interdiction par l’administration des outils d’Anthropic, pour analyser ses propres environnements à la recherche de vulnérabilités potentielles. 

Le secteur financier européen tente d’obtenir accès à Mythos afin de corriger les vulnérabilités avant que des acteurs malveillants n’y accèdent, ou n’accèdent à une technologie d’un niveau de sophistication comparable.

Le règlement européen sur l’IA pourrait également ralentir le cycle de lancement de ces modèles d’IA. S’il se concentre principalement sur les systèmes fondés sur les risques et sur la garantie de la transparence des entreprises européennes ou des entreprises opérant en Europe, il vise aussi les fournisseurs de modèles de fondation en leur imposant une plus grande transparence concernant le développement des modèles et la mise en œuvre des garde-fous.

Dans le même temps, les utilisateurs accordent davantage de crédit à ces chatbots et leur soumettent des requêtes plus complexes et personnelles, notamment en matière de conseils financiers et de problèmes médicaux. Et ce malgré de nombreuses études montrant que les modèles d’IA fournissent régulièrement des informations erronées : un audit de BMJ Open a constaté que près de 50 % de toutes les réponses étaient problématiques.

Ces modèles d’IA puisent toujours leurs informations sur Internet, qui n’est pas vraiment un bastion de l’information exacte, même dans les meilleures circonstances. 

Google a récemment essuyé de vives critiques après qu’une enquête de la BBC a révélé que des contenus trompeurs avaient été publiés pour piéger son outil AI Overview en les structurant de manière à les aider à se classer devant les pages concurrentes.

David Curry

David Curry is a tech journalist and analyst with over a decade of experience writing for established outlets. He holds a master’s degree in International Journalism from the University of Leeds and has covered the technology sector since the early 2010s. His work focuses on B2B technology, data journalism, mobile apps and app markets, artificial intelligence, digital platforms, and emerging technologies. He earned a BA from the University of Lincoln and an MA from the University of Leeds.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.