Xiaomi hat MiMo-V2.6 mit herunterladbaren Gewichten der Modelle Pro und Flash, einem kleineren Forschungsmodell mit 9 Milliarden Parametern sowie Ressourcen für Reinforcement Learning veröffentlicht, die sich an Entwickler richten, die das Training agentischer KI untersuchen.
Die Veröffentlichung geht über die übliche Bereitstellung eines Modell-Checkpoints hinaus. Xiaomi veröffentlicht die Modellgewichte zusammen mit mehr als 7.000 RL-Aufgabenumgebungen und einem durchgängigen Trainings-Framework und berichtet zugleich über deutliche Leistungssteigerungen durch das den Modellen zugrunde liegende Reinforcement-Learning-System.
Laut Xiaomis Veröffentlichung von MiMo-V2.6sind MiMo-V2.6-Pro-RL und MiMo-V2.6-Flash-RL die beiden zentralen multimodalen Modelle. Xiaomi hat außerdem MiMo-V2.6-Distill-Qwen-9B veröffentlicht, einen kleineren Checkpoint, der durch Fine-Tuning von Alibabas Qwen3.5-9B mit von MiMo generierten Daten entstanden ist.
Die Hugging-Face-Repositories von Pro, Flash und 9B führen MIT-Lizenzen auf. Damit reiht sich MiMo-V2.6 in das wachsende Feld chinesischer Open-Weight-KI-Modelle ein, die bei Kosten, Bereitstellungskontrolle und agentischen Fähigkeiten miteinander konkurrieren.
Was Xiaomi mit MiMo-V2.6 veröffentlicht hat
Das MiMo-V2.6-Pro-RL-Repository beschreibt Pro als den Flaggschiff-Checkpoint mit Text-, Bild-, Video- und Audioeingaben sowie einem Kontextfenster von bis zu 1 Million Tokens. Flash zielt innerhalb derselben Familie auf eine stärker auf Effizienz ausgerichtete Position.
Die 9B-Veröffentlichung verfolgt einen anderen Zweck. Die Modellkarte beschreibt MiMo-V2.6-Distill-Qwen-9B als einen überwacht feinabgestimmten Checkpoint, der als Ausgangspunkt für die Forschung zu agentischem Reinforcement Learning gedacht ist und nicht als kleinere Entsprechung von Pro oder Flash.
Diese Unterscheidung ist wichtig, weil Unternehmen, die die Veröffentlichung bewerten, drei unterschiedliche Ressourcen betrachten: zwei große, mit RL trainierte Modelle, die direkt eingesetzt werden können, sowie einen kleineren Checkpoint, der weitere Experimente unterstützen soll.
Xiaomi zufolge umfasst die Open-Source-Veröffentlichung außerdem mehr als 7.000 RL-Umgebungen für Softwareentwicklung, die Reproduktion von Schwachstellen, wissensintensive Aufgaben und Webentwicklung sowie ein Framework für die Interaktion mit Umgebungen, die Sammlung von Trajektorien, die Bewertung von Belohnungen und die Policy-Optimierung.
Das Unternehmen berichtet, dass seine größeren Trainingsläufe 1.568 Prompts und 16 Rollouts pro Trainingsschritt verwendeten und dabei Milliarden Tokens pro Aktualisierung erzeugten. Xiaomi zufolge kostete die RL-Phase rund 2,62 Millionen US-Dollar für Pro und 850.000 US-Dollar für Flash, ohne Pretraining und weitere Entwicklungsarbeiten.
Diese Zahlen stammen von Xiaomi. Unabhängige Tests liefern jedoch einige externe Hinweise zum fertigen Pro-Modell: Artificial Analysis bewertet MiMo-V2.6-Pro derzeit mit 46 auf seinem Intelligence Index und führt es unter den führenden Open-Weight-Modellen auf, die das Unternehmen getestet hat.
Dieses Ergebnis bewertet die Fähigkeiten des veröffentlichten Modells. Es bestätigt jedoch nicht unabhängig Xiaomis Angaben dazu, welche Bestandteile seines RL-Systems die Verbesserungen hervorgebracht haben.
Was eWeek herausgefunden hat: Was Unternehmen heute überprüfen können
Die Untersuchung von Xiaomis Veröffentlichungsmaterialien, öffentlichen Modell-Repositories und unabhängigen Benchmark-Bewertungen durch eWeek weist auf mehrere Unterscheidungen hin, die Unternehmen im Blick behalten sollten:
- Die Modellveröffentlichungen sind öffentlich überprüfbar. Pro-RL, Flash-RL und MiMo-V2.6-Distill-Qwen-9B verfügen über öffentliche Hugging-Face-Repositories, und für jedes ist derzeit eine MIT-Lizenz angegeben.
- Das 9B-Modell ist keine Mini-Version von Pro. Xiaomi bezeichnet es als einen überwacht feinabgestimmten Qwen3.5-9B-Checkpoint für die RL-Forschung. Teams, die das Modell bewerten, sollten nicht davon ausgehen, dass sich die Leistung von Xiaomis Pro oder Flash auf das kleinere Modell übertragen lässt.
- Unabhängige Tests stützen die Wettbewerbsfähigkeit von Pro, nicht jedoch Xiaomis gesamte Darstellung des Trainings. Artificial Analysis hat MiMo-V2.6-Pro unabhängig getestet und damit Belege geliefert, die über Xiaomis eigene Benchmark-Tabellen hinausgehen. Diese Tests belegen nicht, dass eine andere Organisation mit Xiaomis RL-Framework dieselben Verbesserungen erzielen würde.
- Einige viel beachtete Coding-Benchmarks müssen eingeordnet werden. Xiaomi berichtet Ergebnisse zu SWE-bench Verified und DeepSWE v1.1. Epoch AI stuft SWE-bench Verified und DeepSWE v1.1 derzeit aufgrund von Problemen bei Bewertung, Kontamination oder Aufgabenqualität als fehlerhaft ein. Diese Einschätzungen entkräften MiMo-V2.6 nicht, schränken jedoch ein, was sich allein aus den Ergebnissen ableiten lässt.
- Die Beweislage zur Cybersicherheit bleibt begrenzter. Xiaomi berichtet Verbesserungen bei seinem eigenen MiMo-Cyber-Benchmark, während unabhängige, spezifisch auf MiMo-V2.6 ausgerichtete Sicherheitstests bislang begrenzt sind. Eine frühere Analyse von eWeek zu Open-Weight-Cybersicherheitsmodellen ergab, dass externe Tests ein deutlich engeres Bild liefern können als die Benchmark-Angaben der Anbieter.
Für Unternehmenskäufer lautet die unmittelbare Bewertungsfrage daher nicht, ob MiMo-V2.6 existiert oder ob sich seine Gewichte herunterladen lassen. Diese Punkte sind eindeutig.
Die verbleibende Arbeit ist anwendungsspezifisch: das konkret in Betracht gezogene Modell testen, die Infrastrukturanforderungen überprüfen, Sicherheits- und Datenverarbeitungskontrollen bewerten und Xiaomis vom Anbieter gemeldete Benchmark-Fortschritte mit unabhängigen Ergebnissen vergleichen, sobald weitere Tests verfügbar sind.
Da der 9B-Checkpoint auf Qwen3.5 basiert, sollten Teams außerdem die genaue Abhängigkeits- und Lizenzkette prüfen, statt „MiMo-V2.6“ als einheitliches Softwarepaket zu behandeln. Die jüngsten Änderungen an der Qwen-Lizenzierungveranschaulichen, wie stark die Bedingungen zwischen Modellen innerhalb desselben übergeordneten Ökosystems variieren können.
Lesen Sie auch: Nvidia Cosmos 3 ist ein weiteres Beispiel für eine Open-Weight-KI-Veröffentlichung, bei der die Verfügbarkeit des Modells nur ein Teil der Entscheidung über den Unternehmenseinsatz ist.


