Xiaomi a publié MiMo-V2.6 avec les poids téléchargeables des modèles Pro et Flash, un modèle de recherche plus compact doté de 9 milliards de paramètres, ainsi que des ressources d'apprentissage par renforcement destinées aux développeurs qui étudient l'entraînement d'IA agentique.
Cette publication va au-delà d'une simple mise à disposition de point de contrôle. Xiaomi publie les poids des modèles avec plus de 7 000 environnements de tâches pour l'apprentissage par renforcement et un framework d'entraînement de bout en bout, tout en faisant état d'importants gains de performances grâce au système d'apprentissage par renforcement qui sous-tend les modèles.
Selon la publication de MiMo-V2.6 par Xiaomi, MiMo-V2.6-Pro-RL et MiMo-V2.6-Flash-RL sont les deux principaux modèles multimodaux. Xiaomi a également publié MiMo-V2.6-Distill-Qwen-9B, un point de contrôle plus compact créé en affinant Alibaba's Qwen3.5-9B sur des données générées par MiMo.
Les dépôts Hugging Face des modèles Pro, Flash et 9B sont placés sous licences MIT. MiMo-V2.6 rejoint ainsi un nombre croissant de modèles d'IA chinois à poids ouverts qui se disputent les avantages en matière de coûts, de contrôle du déploiement et de capacités agentiques.
Ce que Xiaomi a publié avec MiMo-V2.6
Le dépôt MiMo-V2.6-Pro-RL décrit Pro comme le point de contrôle phare, acceptant des entrées texte, image, vidéo et audio, avec une fenêtre de contexte pouvant atteindre 1 million de tokens. Flash vise une position davantage axée sur l'efficacité au sein de la même famille.
La publication du modèle 9B répond à un objectif différent. Sa fiche décrit MiMo-V2.6-Distill-Qwen-9B comme un point de contrôle affiné par apprentissage supervisé, destiné à servir de point de départ pour la recherche sur l'apprentissage par renforcement agentique, et non comme une version réduite équivalente de Pro ou de Flash.
Cette distinction est importante, car les entreprises qui évaluent cette publication examinent trois actifs différents : deux grands modèles entraînés par apprentissage par renforcement pouvant être déployés directement, ainsi qu'un point de contrôle plus compact conçu pour permettre de nouvelles expérimentations.
Xiaomi affirme que sa publication open source comprend également plus de 7 000 environnements d'apprentissage par renforcement couvrant le génie logiciel, la reproduction de vulnérabilités, les tâches à forte composante de connaissances et le développement web, ainsi qu'un framework pour l'interaction avec les environnements, la collecte de trajectoires, l'évaluation des récompenses et l'optimisation de la politique.
L'entreprise indique que ses entraînements de grande ampleur utilisaient 1 568 prompts et 16 déroulements par étape d'entraînement, générant des milliards de tokens par mise à jour. Xiaomi affirme que la phase d'apprentissage par renforcement a coûté environ 2,62 millions de dollars US pour Pro et 850 000 dollars US pour Flash, hors préentraînement et autres travaux de développement.
Ces chiffres proviennent de Xiaomi. Des tests indépendants apportent néanmoins certains éléments extérieurs concernant le modèle Pro finalisé : Artificial Analysis attribue actuellement à MiMo-V2.6-Pro un score de 46 sur son Intelligence Index et le classe parmi les principaux modèles à poids ouverts qu'il a testés.
Ce résultat évalue les capacités du modèle publié. Il ne valide pas de manière indépendante les affirmations de Xiaomi concernant les éléments de son système d'apprentissage par renforcement qui auraient produit ces gains.
Ce qu'eWeek a établi : ce que les entreprises peuvent vérifier aujourd'hui
L'examen par eWeek des documents de publication de Xiaomi, des dépôts de modèles publics et des évaluations indépendantes de benchmarks met en évidence plusieurs distinctions que les entreprises doivent garder à l'esprit :
- Les publications des modèles peuvent être vérifiées publiquement. Pro-RL, Flash-RL et MiMo-V2.6-Distill-Qwen-9B disposent de dépôts publics sur Hugging Face, et chacun mentionne actuellement une licence MIT.
- Le modèle 9B n'est pas une version miniature de Pro. Xiaomi le présente comme un point de contrôle Qwen3.5-9B affiné par apprentissage supervisé pour la recherche sur l'apprentissage par renforcement. Les équipes qui l'évaluent ne doivent pas supposer que les performances de Pro ou de Flash de Xiaomi se retrouvent sur le modèle plus compact.
- Les tests indépendants confirment la compétitivité de Pro, et non l'intégralité du récit de Xiaomi sur son entraînement. Artificial Analysis a testé MiMo-V2.6-Pro de manière indépendante, apportant des éléments qui vont au-delà des propres tableaux de benchmarks de Xiaomi. Ces tests n'établissent pas qu'une autre organisation obtiendrait les mêmes gains avec le framework d'apprentissage par renforcement de Xiaomi.
- Certains benchmarks de programmation très médiatisés doivent être nuancés. Xiaomi communique des résultats sur SWE-bench Verified et DeepSWE v1.1. Epoch AI classe actuellement SWE-bench Verified et DeepSWE v1.1 comme défaillants en raison de problèmes de notation, de contamination ou de qualité des tâches. Ces évaluations n'invalident pas MiMo-V2.6, mais elles limitent ce que les seuls scores peuvent établir.
- Les éléments concernant la cybersécurité restent plus limités. Xiaomi fait état d'améliorations sur son propre benchmark MiMo Cyber, tandis que les tests de sécurité indépendants spécifiques à MiMo-V2.6 restent limités. Une précédente analyse d'eWeek consacrée aux modèles de cybersécurité à poids ouverts a constaté que les tests externes peuvent donner une vision beaucoup plus limitée que les affirmations des fournisseurs fondées sur leurs benchmarks.
Pour les acheteurs professionnels, la question immédiate n'est donc pas de savoir si MiMo-V2.6 existe ou si ses poids peuvent être téléchargés. Ces points sont établis.
Le travail restant dépend de la charge de travail : tester le modèle exact envisagé, vérifier les exigences d'infrastructure, évaluer les contrôles de sécurité et de gestion des données, puis comparer les gains annoncés par Xiaomi dans ses benchmarks avec les résultats indépendants à mesure que de nouveaux tests seront disponibles.
Comme le point de contrôle 9B repose sur Qwen3.5, les équipes doivent également examiner précisément la chaîne des dépendances et des licences plutôt que de considérer « MiMo-V2.6 » comme un unique progiciel. De récentes évolutions des licences de Qwen montrent que les conditions peuvent varier d'un modèle à l'autre au sein d'un même écosystème plus vaste.
À lire également : Nvidia Cosmos 3 offre un autre exemple de publication d'IA à poids ouverts où la disponibilité du modèle ne constitue qu'un des éléments de la décision de déploiement en entreprise.


