Xiaomi trainierte ein Modell live und gab in sechs Tagen 3,5 Millionen Dollar aus
MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktive. Im offenen Live-Training erreichte es 46 Punkte im Index von Artificial Analysis und Platz eins unter den offenen Modellen.

Xiaomi hat aus dem Modelltraining eine öffentliche Show gemacht. Sechs Tage lang lief eine Übertragung des Trainings mit bestärkendem Lernen, in der ein Ausgabenzähler in Echtzeit stieg. Wie das chinesische Portal QbitAI berichtet, absolvierten beide Modelle je 30 Trainingsschritte, MiMo-V2.6-Pro und MiMo-V2.6-Flash. Die Endabrechnung blieb bei 3,5 Millionen Dollar stehen, also rund 23,44 Millionen Yuan.
Die Aufschlüsselung zeigt, wie teuer bestärkendes Lernen im großen Maßstab heute ist. Allein Pro brauchte 5 Tage und 3 Stunden sowie rund 2,6 Millionen Dollar. Flash kam auf 3 Tage und 10 Stunden für rund 0,9 Millionen Dollar. Jeder Schritt enthielt 1568 Prompts. Für jede Aufgabe probierte das Modell 16 verschiedene Pfade aus, sodass über 25 Tsd. Durchläufe pro Schritt zusammenkamen. Bei 2,7 bis 3,7 Milliarden Trainings-Token pro Schritt verarbeitete Pro im gesamten Training rund 81 bis 111 Milliarden Token. Nach der Rechnung des Portals entspricht das mehr als 80 Tsd. Kontextfenstern von einer Million Token Länge.
Ergebnis und Vergleich mit der Frontier
MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktive, und erreichte 46 Punkte im Intelligenzindex von Artificial Analysis. Damit liegt es auf Platz eins unter den offenen Modellen. In den meisten Agenten-Tests kommt das Ergebnis von Pro an Claude Opus 5 und GPT-5.6 Sol heran. Die Leiterin des Projekts MiMo, Luo Fuli, die zuvor an DeepSeek-R1 mitgearbeitet hatte, nannte es eines der größten einzelnen Trainings mit bestärkendem Lernen, das das Team eines offenen Modells durchgeführt habe. Die technische Herausforderung, so fügte sie hinzu, habe jene übertroffen, an die sie sich von DeepSeek-R1 erinnere.
Offenheit als Strategie, nicht als Geste
Parallel veröffentlicht Xiaomi Details zur Architektur. MiMo-V3 stützt sich auf HySparse2, optimiert für lange, mehrstufige Agenten-Aufgaben: zweistufiges KV-Sharing, sparsame Token-Auswahl und ein früherer Austritt aus der Vorphasen-Stufe. Der Rechenaufwand der Vorphasen-Stufe sinkt damit auf ein Fünftel des Werts der Lösung HySparse mit hybridem Aufmerksamkeitsfenster. Der KV-Cache schrumpft von 12 GB auf 2,7 GB bei einem Kontext von einer Million Token. Laut Xiaomi sinkt die Fähigkeit zur Suche in langen Texten dabei nicht, sondern steigt.
Dieselbe Richtung zeigt sich in der DeepSeek-Familie: Chinesische Modelle konkurrieren heute nicht mit der Spitze der Parameter, sondern mit den Kosten für den Unterhalt eines langen Kontexts. Für den Endnutzer zählt noch etwas anderes: dass die Gewichte offengelegt werden, sodass man die Ergebnisse nicht auf Treu und Glauben hinnehmen muss.
Quellen
2Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.