OpenBMB a lancé MiniCPM5-2B le 7 septembre, un modèle d’IA de 2,52 milliards de paramètres conçu pour les assistants locaux, le code, l’utilisation d’outils et d’autres tâches qui ne nécessitent pas toujours un modèle beaucoup plus grand. OpenBMB indique avoir obtenu une moyenne de 53,9 sur 34 tests, supérieure à celle de tous les modèles plus grands évalués en parallèle.
Son concurrent plus grand le plus proche était Qwen3.5-4B, avec une moyenne de 51,1. MiniCPM5-2B l’a devancé dans 20 des 34 tests individuels, mais a perdu les 14 autres : l’avantage du modèle plus petit dépend donc largement de la tâche évaluée.
La fiche du modèle MiniCPM5-2B d’OpenBMB répertorie 2 516 756 480 paramètres et la prise en charge d’entrées allant jusqu’à 131 072 jetons. Il est distribué sous licence Apache 2.0.
Les modèles plus petits nécessitent généralement moins de ressources informatiques que les modèles beaucoup plus grands, ce qui peut les rendre plus faciles à exécuter en local.
Cela a contribué à stimuler l’intérêt des entreprises pour les petits modèles de langage destinés à des charges de travail ciblées, lorsque le coût, la rapidité ou le maintien des données sur les systèmes locaux est prioritaire.
OpenBMB propose également des versions conçues pour llama.cpp, Ollama, LM Studio et Apple Silicon, offrant aux développeurs plusieurs moyens de tester MiniCPM5-2B sur du matériel d’IA local.
Où MiniCPM5-2B surpasse Qwen3.5-4B
MiniCPM5-2B se montre particulièrement performant dans le code et les tâches qui exigent d’un système d’IA qu’il utilise des outils ou accomplisse plusieurs étapes. Il surpasse Qwen3.5-4B dans les cinq tests de raisonnement appliqué au code et les trois tests d’utilisation d’outils des résultats d’OpenBMB.
Les résultats sont nettement moins bons en matière de connaissances générales. Qwen3.5-4B remporte les cinq tests de connaissances générales ainsi que trois des quatre tests impliquant de très grandes quantités d’entrées.
Les résultats des agents de codage sont également contrastés. MiniCPM5-2B obtient 46,4 contre 33,6 sur SWE-bench Verified, mais Qwen3.5-4B l’emporte 28,2 à 14,4 sur SWE-bench Pro et 25,8 à 8,6 sur Terminal-Bench v2.1.
La plupart de ces résultats ont été obtenus ou reproduits par OpenBMB ; ils doivent donc toujours être considérés comme des évaluations communiquées par le fournisseur.
Des tests indépendants étayent en partie cette affirmation plus générale sur les performances : Artificial Analysis a attribué à MiniCPM5-2B un score de 15 sur son Intelligence Index v4.2, le meilleur résultat parmi les modèles à poids ouverts de moins de 4 milliards de paramètres au moment de sa sortie.
La licence Apache 2.0 autorise l’utilisation commerciale, la modification et la redistribution sous réserve du respect de ses conditions. Alibaba utilise également cette licence pour Qwen3.8-27B, un autre modèle ouvert récent destiné aux développeurs.
Ce qu’eWeek a constaté : commencer par les agents et l’utilisation d’outils
Le bilan de 20 victoires contre 14 devient plus utile lorsque les tests sont regroupés selon le type de travail qu’ils évaluent.
| Charge de travail | MiniCPM5-2B par rapport à Qwen3.5-4B | Prochaine étape recommandée |
|---|---|---|
| Raisonnement appliqué au code | 5–0 | Donner la priorité aux pilotes de codage |
| Raisonnement mathématique | 2–2 | Tester des problèmes propres à l’entreprise |
| Suivi des instructions | 1–2 | Vérifier le formatage et le respect des règles |
| Connaissances générales | 0–5 | Valider soigneusement les questions-réponses générales |
| Documents longs | 1–3 | Tester directement les fichiers volumineux |
| Utilisation d’outils | 3–0 | Donner la priorité aux pilotes d’API et d’appels d’outils |
| Agents de codage | 1–2 | Tester des dépôts réels |
| Agents de recherche | 3–0 | Tester les flux de recherche et de récupération d’informations |
| Agents généralistes | 4–0 | Tester l’automatisation en plusieurs étapes |
Pour les équipes qui doivent choisir où consacrer leur temps d’évaluation, les résultats publiés favorisent les flux de travail avec agents, les appels d’outils, la recherche et le raisonnement appliqué au code. Les connaissances générales et le traitement de documents longs appellent davantage de prudence malgré la moyenne globale plus élevée et la limite de 131 072 jetons.
Le codage nécessite également des tests adaptés à la charge de travail. Remporter un benchmark logiciel ne garantit pas qu’un modèle saura gérer de manière fiable les dépôts, les outils et le processus de développement d’une entreprise. D’autres benchmarks de codage de l’IA se heurtent au même écart entre les tests contrôlés et le travail logiciel en production.
MiniCPM5-2B propose donc aux équipes une thèse plus nuancée que « plus petit signifie meilleur ». Ses résultats publiés les plus solides identifient des charges de travail précises pour lesquelles un modèle de 2,52 milliards de paramètres pourrait remplacer un modèle plus grand, tandis que ses défaites montrent dans quels cas ce remplacement pourrait dégrader la qualité.
Tester directement ces charges de travail permet de déterminer si l’empreinte réduite offre un avantage utile en matière de coûts ou de déploiement, sans sacrifier les performances dont une équipe a besoin.
À lire également : DeepSeek V4 Pro associe de solides résultats en codage à des tarifs d’API plus élevés, alors que les développeurs évaluent les performances des modèles au regard de leurs coûts d’exploitation.

