Offene chinesische Modelle: Xiaomi MiMo, DeepSeek und Hugging Face
Xiaomi hat eine Runde Reinforcement Learning live im Stream trainiert. MiMo-V2.6-Pro führt die offenen Modelle mit 1,02 Billionen Parametern und 42 Milliarden aktiven Parametern an. DeepSeek veröffentlichte parallel seine visuelle Experimentversion unter MIT-Lizenz.

In den vergangenen sechs Monaten ist der Wettbewerb unter den offenen chinesischen Großmodellen deutlich schneller geworden. Am 22. September beendete Xiaomi einen sechs Tage dauernden „Alchemie-Stream“, in dem das Reinforcement-Learning-Training des Großmodells direkt im Livestream lief. Die Schlussrechnung lag bei 3,5 Millionen US-Dollar, umgerechnet rund 23,44 Millionen Yuan.
MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktiv. Im Artificial Analysis Intelligence Index erreicht es 46 Punkte und liegt damit auf Platz eins unter den offenen Modellen. MiMo-Leiterin Luo Fuli sagt, dies sei eines der größten einzelnen Reinforcement-Learning-Trainings, das ein Team offener Modelle bisher durchgeführt habe. Der Forschungsaufwand und die technischen Hürden dahinter gingen über die von DeepSeek-R1 hinaus, an dem sie beteiligt war.
Bemerkenswerter ist die Generalisierung außerhalb der Stichprobe. Beim DeepSWE v1.1, der Coding-Agenten prüft, stieg Pro von 58,4 auf 72,57 Punkte, Flash von 48,7 auf 65,68 Punkte. Nach nur 30 Steps wurde das Modell nicht nur weiter stärker. Es übertrug seine Fähigkeiten auch auf Software-Engineering-Aufgaben, die es nie gesehen hatte.
Der Preis stieg nicht mit den Fähigkeiten. MiMo-V2.6 behält die API-Preise der Vorgängergeneration: bei Pro kosten Eingabe und Ausgabe je Million Token etwa 3 Yuan und 6 Yuan, bei Flash etwa 1 Yuan und 2 Yuan. Nach Berechnung von Artificial Analysis kostet MiMo-V2.6-Pro pro Aufgabe im Schnitt nur 0,13 US-Dollar. Das zeitgleich veröffentlichte geschlossene Modell Grok 4.7 kommt im selben Index ebenfalls auf 46 Punkte. Seine hochkonfigurierte Version braucht pro Aufgabe durchschnittlich 3,74 US-Dollar.
Die Liste des Offenen wird länger. Xiaomi hat Modellgewichte, technischen Bericht, mehr als 7000 RL-Aufgabenumgebungen, ein End-to-End-Trainingsframework sowie einen frei kombinierbaren mini-harness freigegeben. Dazu kommt ein Destillationsmodell auf Basis von Qwen3.5-9B, das mit 77,4B Token an MiMo-generierten Daten überwacht feinabgestimmt wurde. Ein ehemaliger Forscher von Hugging Face achtet auf das Tempo: Das endgültige RL-Training startete vor weniger als einer Woche und lieferte bereits Modell und Trainingsframework ab.
DeepSeek stellte am 31. August das erste multimodale Modell der V4-Reihe auf Hugging Face, DeepSeek-V4-Flash-Vision-Exp, unter MIT-Lizenz. Veröffentlicht wurden unter anderem Modelldateien, Tokenizer, eine Referenzimplementierung für das Prompt Encoding sowie eine minimale PyTorch-Inferenzimplementierung. Chinesische Modelle werden in der Open-Source-Community sichtbarer.
Quellen
3- 016 天烧光 2000 多万,拿下开源第一!小米史无前例炼丹直播收官ZH
- 02DeepSeek-V4-Flash-Vision-Exp 模型已开源ZH
- 03DeepSeek-V4.1-Flash 模型卡EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.