MiniCPM5-2B surpasse les modèles d’IA plus grands dans les tests d’OpenBMB

Laptop displaying MiniCPM5-2B AI model

MiniCPM5-2B pairs a 2.52-billion-parameter footprint with strong reported results in coding, tool use, and agent tasks. Image: Generated by ChatGPT.

Written By
eWEEK Staff
eWEEK Staff
Sep 9, 2026
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenBMB a lancé MiniCPM5-2B le 7 septembre, un modèle d’IA de 2,52 milliards de paramètres conçu pour les assistants locaux, le code, l’utilisation d’outils et d’autres tâches qui ne nécessitent pas toujours un modèle beaucoup plus grand. OpenBMB indique avoir obtenu une moyenne de 53,9 sur 34 tests, supérieure à celle de tous les modèles plus grands évalués en parallèle.

Son concurrent plus grand le plus proche était Qwen3.5-4B, avec une moyenne de 51,1. MiniCPM5-2B l’a devancé dans 20 des 34 tests individuels, mais a perdu les 14 autres : l’avantage du modèle plus petit dépend donc largement de la tâche évaluée.

La fiche du modèle MiniCPM5-2B d’OpenBMB répertorie 2 516 756 480 paramètres et la prise en charge d’entrées allant jusqu’à 131 072 jetons. Il est distribué sous licence Apache 2.0.

Les modèles plus petits nécessitent généralement moins de ressources informatiques que les modèles beaucoup plus grands, ce qui peut les rendre plus faciles à exécuter en local.

Cela a contribué à stimuler l’intérêt des entreprises pour les petits modèles de langage destinés à des charges de travail ciblées, lorsque le coût, la rapidité ou le maintien des données sur les systèmes locaux est prioritaire.

OpenBMB propose également des versions conçues pour llama.cpp, Ollama, LM Studio et Apple Silicon, offrant aux développeurs plusieurs moyens de tester MiniCPM5-2B sur du matériel d’IA local.

Où MiniCPM5-2B surpasse Qwen3.5-4B

MiniCPM5-2B se montre particulièrement performant dans le code et les tâches qui exigent d’un système d’IA qu’il utilise des outils ou accomplisse plusieurs étapes. Il surpasse Qwen3.5-4B dans les cinq tests de raisonnement appliqué au code et les trois tests d’utilisation d’outils des résultats d’OpenBMB.

Les résultats sont nettement moins bons en matière de connaissances générales. Qwen3.5-4B remporte les cinq tests de connaissances générales ainsi que trois des quatre tests impliquant de très grandes quantités d’entrées.

Les résultats des agents de codage sont également contrastés. MiniCPM5-2B obtient 46,4 contre 33,6 sur SWE-bench Verified, mais Qwen3.5-4B l’emporte 28,2 à 14,4 sur SWE-bench Pro et 25,8 à 8,6 sur Terminal-Bench v2.1.

Advertisement

La plupart de ces résultats ont été obtenus ou reproduits par OpenBMB ; ils doivent donc toujours être considérés comme des évaluations communiquées par le fournisseur.

Des tests indépendants étayent en partie cette affirmation plus générale sur les performances : Artificial Analysis a attribué à MiniCPM5-2B un score de 15 sur son Intelligence Index v4.2, le meilleur résultat parmi les modèles à poids ouverts de moins de 4 milliards de paramètres au moment de sa sortie.

La licence Apache 2.0 autorise l’utilisation commerciale, la modification et la redistribution sous réserve du respect de ses conditions. Alibaba utilise également cette licence pour Qwen3.8-27B, un autre modèle ouvert récent destiné aux développeurs.

Ce qu’eWeek a constaté : commencer par les agents et l’utilisation d’outils

Le bilan de 20 victoires contre 14 devient plus utile lorsque les tests sont regroupés selon le type de travail qu’ils évaluent.

Charge de travailMiniCPM5-2B par rapport à Qwen3.5-4BProchaine étape recommandée
Raisonnement appliqué au code5–0Donner la priorité aux pilotes de codage
Raisonnement mathématique2–2Tester des problèmes propres à l’entreprise
Suivi des instructions1–2Vérifier le formatage et le respect des règles
Connaissances générales0–5Valider soigneusement les questions-réponses générales
Documents longs1–3Tester directement les fichiers volumineux
Utilisation d’outils3–0Donner la priorité aux pilotes d’API et d’appels d’outils
Agents de codage1–2Tester des dépôts réels
Agents de recherche3–0Tester les flux de recherche et de récupération d’informations
Agents généralistes4–0Tester l’automatisation en plusieurs étapes

Pour les équipes qui doivent choisir où consacrer leur temps d’évaluation, les résultats publiés favorisent les flux de travail avec agents, les appels d’outils, la recherche et le raisonnement appliqué au code. Les connaissances générales et le traitement de documents longs appellent davantage de prudence malgré la moyenne globale plus élevée et la limite de 131 072 jetons.

Le codage nécessite également des tests adaptés à la charge de travail. Remporter un benchmark logiciel ne garantit pas qu’un modèle saura gérer de manière fiable les dépôts, les outils et le processus de développement d’une entreprise. D’autres benchmarks de codage de l’IA se heurtent au même écart entre les tests contrôlés et le travail logiciel en production.

MiniCPM5-2B propose donc aux équipes une thèse plus nuancée que « plus petit signifie meilleur ». Ses résultats publiés les plus solides identifient des charges de travail précises pour lesquelles un modèle de 2,52 milliards de paramètres pourrait remplacer un modèle plus grand, tandis que ses défaites montrent dans quels cas ce remplacement pourrait dégrader la qualité.

Tester directement ces charges de travail permet de déterminer si l’empreinte réduite offre un avantage utile en matière de coûts ou de déploiement, sans sacrifier les performances dont une équipe a besoin.

Advertisement

À lire également : DeepSeek V4 Pro associe de solides résultats en codage à des tarifs d’API plus élevés, alors que les développeurs évaluent les performances des modèles au regard de leurs coûts d’exploitation.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.