La société d’IA Z.ai, basée à Pékin, a dévoilé vendredi GLM-5.3, un modèle à poids ouverts qui revendique des performances de premier plan dans les benchmarks de programmation et des scores compétitifs en détection de vulnérabilités face aux principaux systèmes américains d’Anthropic et d’OpenAI.
Construit sur le même modèle de base de 700 milliards de paramètres que son prédécesseur de juin, GLM-5.2, le modèle doit tous ses gains de performance à un apprentissage par renforcement élargi et à des environnements synthétiques de post-entraînement, a indiqué l’entreprise.
Selon l’entreprise, la publication des poids du modèle sera retardée de deux semaines, le temps d’achever les évaluations de sécurité et le renforcement de la sécurité.
Progrès dans les benchmarks et avancées en cybersécurité
Z.ai a indiqué que GLM-5.3 offre une amélioration de 50 % par rapport à GLM-5.2 sur son benchmark interne Z.ai Code Bench. Lors d’évaluations publiques, le système a obtenu 88,2 à Terminal Bench 2.1, 28,3 à Terminal Bench 3.0 et 66,9 à DeepSWE v1.1.
L’entreprise a mis en avant des capacités émergentes en cybersécurité qui ont évolué au cours du post-entraînement. Sur le benchmark de détection de vulnérabilités CyberGym, GLM-5.3 a obtenu 84,5 %, devançant de peu Mythos 5 d’Anthropic, à 83,8 %, et GPT-5.6 Sol d’OpenAI, à 83,6 %.
Cependant, le modèle reste à la traîne des systèmes américains fermés de pointe pour créer des exploits actifs. Sur ExploitBench, GLM-5.3 a obtenu 54,4 %, contre Mythos 5 avec 78,0 %. Lors d’un test chronométré de six heures sur ExploitGym, GLM-5.3 a réalisé 130 tâches de développement d’attaques, contre 247 tâches enregistrées par Mythos 5.
Parallèlement à cette annonce, Z.ai a lancé le Z.ai Security Disclosure Ledger, qui documente 2 436 vulnérabilités identifiées dans 269 projets logiciels open source, notamment des composants du noyau Linux et des projets Apache.
Accès contrôlé et mesures de sécurité
Pour gérer les risques offensifs, Z.ai a indiqué mettre en place un déploiement par niveaux qui réserve les fonctionnalités sensibles d’exploitation à des partenaires de sécurité évalués dans le cadre d’un programme d’accès de confiance.
L’entreprise a déclaré sur X avoir ajouté des garde-fous pour rejeter les demandes malveillantes tout en permettant les tests défensifs légitimes, écrivant : « Un monde ouvert ne peut pas avoir uniquement des surfaces d’attaque ouvertes. Il doit aussi avoir un bouclier ouvert. »
« À ma connaissance, c’est la première fois qu’un laboratoire chinois justifie publiquement le retard de la mise à disposition des poids d’un modèle ouvert par des considérations de sécurité », a déclaré Gabriel Wagner, chercheur en gouvernance de l’IA chez Concordia AI, selon Reuters.
De solides résultats techniques n’ont pas dissipé les interrogations sur la position commerciale de Z.ai.
Malgré les affirmations concernant son produit, l’action de Z.ai, cotée à Hong Kong, a reculé de près de 4 % vendredi. L’analyste de Bloomberg Intelligence Robert Lea a souligné que « Cette entreprise reste dans une situation commerciale totalement insoutenable », ajoutant que « l’essor de l’IA agentique fera encore augmenter les coûts d’inférence et les pertes de Z.ai ».
Ce que signifie ce lancement
L’importance de GLM-5.3 tient moins au fait de savoir s’il a dépassé tous les principaux modèles américains qu’à la compétitivité croissante des systèmes chinois dans les tâches spécialisées de programmation et de cybersécurité.
Z.ai montre que des modèles de programmation plus performants peuvent émerger grâce au post-entraînement, sans remplacer le modèle sous-jacent. Parallèlement, ses résultats en cybersécurité suggèrent que les systèmes de programmation généralistes peuvent développer des capacités offensives plus rapidement que prévu à mesure que l’entraînement gagne en sophistication.
La question la plus difficile est de savoir ce qui se passe lorsque ces améliorations atteignent des tâches sensibles sur le plan de la sécurité. Z.ai retarde la mise à disposition ouverte des poids de GLM-5.3 pendant qu’elle achève ses travaux de sécurité, soulignant la tension entre l’accès ouvert et le risque que des capacités défensives plus puissantes puissent également être détournées à des fins d’attaque.
Autres actualités : le modèle V4 Pro de DeepSeek défie Claude Opus 5 d’Anthropic auprès des développeurs, intensifiant la concurrence pour déterminer quels modèles d’IA sont les plus performants dans les tâches de programmation.

