Offene Modelle für 3,5 Millionen Dollar: Xiaomi und DeepSeek verändern die Kostenrechnung
MiMo-V2.6-Pro brauchte für 30 Schritte bestärkenden Lernens rund 2,6 Millionen Dollar und lag bei einem Teil der Agentenaufgaben vor geschlossenen Modellen.

Jahrelang galt eine einfache Regel: Das beste Modell ist geschlossen und kostet so viel, wie der Anbieter verlangen will. Das chinesische Portal qbitai (量子位) beschreibt ein Experiment von Xiaomi, das zumindest den zweiten Teil dieser Regel infrage stellt.
In einer Live-Übertragung legte das MiMo-Team unter Leitung von Luo Fuli die Trainingsabrechnung offen. Luo Fuli hatte zuvor an DeepSeek-R1 mitgearbeitet. MiMo-V2.6-Pro absolvierte 30 Schritte bestärkenden Lernens in 5 Tagen und 3 Stunden und verbrauchte rund 2,6 Millionen Dollar. Das leichtere MiMo-V2.6-Flash schaffte dasselbe in 3 Tagen und 10 Stunden für etwa 0,9 Millionen Dollar. Die Gesamtrechnung summierte sich auf rund 3,5 Millionen Dollar.
Die Größe eines einzelnen Schritts erklärt, warum diese Zahlen nicht verschwenderisch sind. Jeder Schritt umfasst 1568 Anfragen, und das Modell probiert für jede davon 16 verschiedene Pfade aus. In einer Runde entstehen so über 25.000 Versuche. Bei 2,7 bis 3,7 Milliarden Trainings-Token pro Schritt verarbeitete das Modell Pro insgesamt rund 81 bis 111 Milliarden Token. Das entspricht mehr als 80.000 Kontextfenstern von einer Million Token Länge.
Ergebnisse, die sich überprüfen lassen
Die Wirkung zeigt Xiaomi an zwei Stellen. Die durchschnittliche Bestehensquote stieg nach 30 Schritten um 25 Prozent (Version Flash) und 12 Prozent (Pro). Wichtiger ist der Test außerhalb des Trainingsdatensatzes. Bei DeepSWE v1.1, der die Arbeit eines Agenten in echten Code-Repositories prüft, verbesserte sich Pro von 58,4 auf 72,57 Punkte, Flash von 48,7 auf 65,68. Das Modell hat die Aufgaben also nicht nur gespeichert. Es hat die Fähigkeiten auf völlig neue Ingenieursprobleme übertragen.
Im Ranking Artificial Analysis Intelligence Index erreichte MiMo-V2.6-Pro 46 Punkte und lag damit an erster Stelle unter den offenen Modellen. In der Aufgabe AutomationBench kam es auf 53,1 Punkte und lag vor Claude Opus 5 (50,3) und GPT-5.6 Sol (45,8). Der Preis blieb gegenüber der vorigen Generation unverändert: Pro etwa 3 Yuan für eine Million Eingabe-Token und 6 für die Ausgabe, Flash entsprechend 1 und 2. Schätzungen von Artificial Analysis zufolge kostet die durchschnittliche Ausführung einer Aufgabe aus dem Index bei Pro 0,13 Dollar. Zum Vergleich: Das Modell Grok 4.7, das am selben Tag identische 46 Punkte erzielte, soll in der Variante xHigh rund 3,74 Dollar kosten, also fast 29 Mal so viel.
Nicht nur Code
Interessanter fällt die wissenschaftliche Anwendung aus. Xiaomi ließ das Modell Materialien vom Typ MOF entwerfen, die PFAS einfangen sollen, dauerhafte Schadstoffe, die sich nicht zersetzen. Das Modell sah Literatur und Patente durch und prüfte selbst, ob die Idee neu ist. Danach baute es eine Simulationsumgebung und berechnete die Bindungsstärke. Es schlug zwei Strukturen vor, A50 und B50, auf Basis von Zirkonium-Gerüsten des Typs UiO-67. Deren PFAS-Adsorption soll eine Million bis zehn Millionen Mal besser sein als die des Referenzmaterials. Der im Bericht zitierte Professor Dou Jinhu von der Universität Peking bewertete das Ergebnis als Arbeit auf dem Niveau eines erfahrenen Doktoranden. Der Forschungszyklus im Unternehmen verkürzte sich von einem Monat auf zwei bis drei Tage.
Offenheit ist kein Marketingwort mehr, sondern ein Weg, die Kosten einer einzelnen Aufgabe von einigen Dollar auf wenige Cent zu senken.
Im Hintergrund wirkt derselbe Mechanismus wie bei DeepSeek-V4.1-Flash, das mit 552 Milliarden Parametern und MIT-Lizenz die Speicheranforderungen der Inferenz senkte. Xiaomi veröffentlichte nicht nur Gewichte und technischen Bericht, sondern auch über 7.000 Aufgabenumgebungen für bestärkendes Lernen, das vollständige Trainings-Framework und ein kleines destilliertes Modell auf Basis von Qwen3.5-9B. Das ist eine qualitative Verschiebung in der Debatte über Offenheit: Es geht nicht mehr darum, eine Datei mit Gewichten bereitzustellen, sondern den gesamten Produktionsprozess herauszugeben.
Quellen
3- 01量子位 (qbitai): 小米 MiMo-V2.6 强化学习直播 — 350万美元的训练ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek-V4.1-Flash – model cardEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.