Le GLM-5.2 de Z.ai repousse les limites de l’IA de cybersécurité à poids ouverts

Screenshot of Z.ai’s GLM-5.2 model card on Hugging Face

Image: Z.ai via Hugging Face

Written By
eWEEK Staff
eWEEK Staff
Jun 29, 2026
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Le GLM-5.2 de Z.ai transforme une bataille de benchmarks techniques en une question plus vaste pour les entreprises : quelle quantité de capacités de cybersécurité celles-ci devraient-elles confier à un modèle d’IA à poids ouverts ?

Des tests indépendants menés par Semgrep et Graphistry suggèrent que le dernier modèle du laboratoire chinois d’IA peut rivaliser sur certaines tâches de détection des vulnérabilités et d’investigation de sécurité. Ces résultats étayent une affirmation limitée concernant l’analyse de sécurité assistée, et non une équivalence générale avec les modèles Claude Mythos à accès restreint d’Anthropic pour la génération d’exploits ou la recherche autonome de failles zero-day.

Les tests de benchmark montrent une victoire limitée

Z.ai, auparavant connue internationalement sous le nom de Zhipu AI, décrit GLM-5.2 comme un modèle à long contexte publié sous licence MIT. La fiche de l’entreprise fiche modèle de GLM-5.2 indique qu’il prend en charge une fenêtre de contexte de 1 million de tokens et affiche des scores de 81,0 à Terminal-Bench 2.1 et de 62,1 à SWE-bench Pro.

Il s’agit de benchmarks de programmation communiqués par le fournisseur, et non d’une preuve directe des performances en cybersécurité. Les éléments les plus probants proviennent de tests de sécurité externes, même si ceux-ci montrent également pourquoi il faut nuancer l’idée d’un « concurrent de Mythos ».

Dans le benchmark IDOR de Semgrep, GLM-5.2 a obtenu un score F1 de 39 % pour la détection des références directes non sécurisées à des objets. Il a ainsi devancé deux configurations de Claude Code, qui ont obtenu 37 % et 28 %, mais est resté derrière le pipeline multimodal de Semgrep, à 53 %–61 %.

La comparaison est utile, mais elle ne constitue pas une victoire nette d’un modèle sur l’autre, car le pipeline le mieux classé de Semgrep reposait sur un workflow conçu sur mesure.

L’évaluation CyBT-CTF de Graphistry a révélé une tendance similaire. GLM-5.2 a affiché un taux de résolution de 28/59, ce qui en a fait le meilleur modèle à poids ouverts de ce test, à égalité avec certaines configurations de modèles propriétaires. Graphistry a également constaté que son harnais Louie.ai avec Claude Opus avait obtenu 35/59, montrant que les outils et l’orchestration peuvent modifier le résultat.

Cette affirmation s’inscrit également dans une tendance plus large en APAC. Z.ai n’est pas le seul acteur régional à positionner des systèmes d’IA face à des outils de cybersécurité de classe Mythos ; une autre entreprise chinoise de cybersécurité a récemment formulé une affirmation similaire autour de la découverte assistée par l’IA de vulnérabilités.

Advertisement

Pris ensemble, les résultats publics présentent GLM-5.2 comme un modèle sérieux pour l’analyse assistée des vulnérabilités. Ils ne prouvent pas qu’il égale Mythos dans la création d’exploits, leur militarisation ou la recherche offensive de bout en bout.

Le déploiement à poids ouverts crée un risque pour les entreprises

La conception à poids ouverts constitue l’enjeu pour les entreprises derrière le débat sur les benchmarks. Contrairement aux systèmes propriétaires accessibles par API, GLM-5.2 peut être téléchargé et exécuté dans l’environnement même d’une organisation, ce qui peut séduire les équipes qui traitent du code source sensible, des journaux ou des rapports de vulnérabilité ne pouvant pas facilement sortir des systèmes internes. Mais la valeur du modèle dépend moins de l’équivalence affichée dans les benchmarks que de sa capacité à améliorer les workflows supervisés sans affaiblir la gouvernance.

Le déploiement local transfère également la responsabilité. Les organisations qui utilisent GLM-5.2 doivent elles-mêmes gérer les contrôles d’accès, la journalisation, la supervision, les tests en red team et l’application des politiques. Les garde-fous du fournisseur comptent moins une fois qu’un modèle est téléchargé, modifié ou connecté à des outils internes, raison pour laquelle les modèles d’IA à accès restreint prennent place dans le débat plus large sur les modèles capables d’opérations cyber.

Cet arbitrage fonctionne dans les deux sens. Les défenseurs peuvent utiliser des modèles à poids ouverts pour accélérer la revue de code, le triage des vulnérabilités et les investigations de sécurité. Les attaquants peuvent exploiter la même accessibilité pour tester des cibles, automatiser la reconnaissance ou supprimer les garde-fous. Axios a rapporté que des responsables américains avaient récemment autorisé le retour limité des modèles Mythos d’Anthropic après des restrictions antérieures liées à des préoccupations de cybersécurité.

Les équipes chargées des achats devraient considérer GLM-5.2 comme un modèle à évaluer, et non comme un remplaçant de Mythos. Les cas d’usage les plus prometteurs à court terme sont la revue de code supervisée par des humains, le triage des vulnérabilités et l’analyse de sécurité interne. De récentes accusations de distillation de modèles d’IA montrent également pourquoi la provenance des modèles, les contrôles d’accès et les déclarations de sécurité deviennent des enjeux liés aux achats, et non plus seulement des préoccupations de laboratoires de recherche.

Les prochains points à surveiller : des évaluations indépendantes de GLM-5.2 axées sur les exploits, des retours d’expérience sur des déploiements réels en entreprise et les mesures politiques visant la distribution des modèles à poids ouverts.

À lire également : pour mieux comprendre comment les systèmes d’IA d’Anthropic capables d’opérations cyber sont devenus un point de friction politique, consultez cette chronologie de la collision de Claude avec le gouvernement américain.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.