Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Xiaomi trainierte ein Modell live und gab in sechs Tagen 3,5 Millionen Dollar aus

MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktive. Im offenen Live-Training erreichte es 46 Punkte im Index von Artificial Analysis und Platz eins unter den offenen Modellen.

KI & ModelleNachrichtKatrin HoffmannVeröffentlicht: 23. September 20265 Min. LesezeitQuellen 2
Xiaomi trainierte ein Modell live und gab in sechs Tagen 3,5 Millionen Dollar aus

Xiaomi hat aus dem Modelltraining eine öffentliche Show gemacht. Sechs Tage lang lief eine Übertragung des Trainings mit bestärkendem Lernen, in der ein Ausgabenzähler in Echtzeit stieg. Wie das chinesische Portal QbitAI berichtet, absolvierten beide Modelle je 30 Trainingsschritte, MiMo-V2.6-Pro und MiMo-V2.6-Flash. Die Endabrechnung blieb bei 3,5 Millionen Dollar stehen, also rund 23,44 Millionen Yuan.

Die Aufschlüsselung zeigt, wie teuer bestärkendes Lernen im großen Maßstab heute ist. Allein Pro brauchte 5 Tage und 3 Stunden sowie rund 2,6 Millionen Dollar. Flash kam auf 3 Tage und 10 Stunden für rund 0,9 Millionen Dollar. Jeder Schritt enthielt 1568 Prompts. Für jede Aufgabe probierte das Modell 16 verschiedene Pfade aus, sodass über 25 Tsd. Durchläufe pro Schritt zusammenkamen. Bei 2,7 bis 3,7 Milliarden Trainings-Token pro Schritt verarbeitete Pro im gesamten Training rund 81 bis 111 Milliarden Token. Nach der Rechnung des Portals entspricht das mehr als 80 Tsd. Kontextfenstern von einer Million Token Länge.

Ergebnis und Vergleich mit der Frontier

MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktive, und erreichte 46 Punkte im Intelligenzindex von Artificial Analysis. Damit liegt es auf Platz eins unter den offenen Modellen. In den meisten Agenten-Tests kommt das Ergebnis von Pro an Claude Opus 5 und GPT-5.6 Sol heran. Die Leiterin des Projekts MiMo, Luo Fuli, die zuvor an DeepSeek-R1 mitgearbeitet hatte, nannte es eines der größten einzelnen Trainings mit bestärkendem Lernen, das das Team eines offenen Modells durchgeführt habe. Die technische Herausforderung, so fügte sie hinzu, habe jene übertroffen, an die sie sich von DeepSeek-R1 erinnere.

Offenheit als Strategie, nicht als Geste

Parallel veröffentlicht Xiaomi Details zur Architektur. MiMo-V3 stützt sich auf HySparse2, optimiert für lange, mehrstufige Agenten-Aufgaben: zweistufiges KV-Sharing, sparsame Token-Auswahl und ein früherer Austritt aus der Vorphasen-Stufe. Der Rechenaufwand der Vorphasen-Stufe sinkt damit auf ein Fünftel des Werts der Lösung HySparse mit hybridem Aufmerksamkeitsfenster. Der KV-Cache schrumpft von 12 GB auf 2,7 GB bei einem Kontext von einer Million Token. Laut Xiaomi sinkt die Fähigkeit zur Suche in langen Texten dabei nicht, sondern steigt.

Dieselbe Richtung zeigt sich in der DeepSeek-Familie: Chinesische Modelle konkurrieren heute nicht mit der Spitze der Parameter, sondern mit den Kosten für den Unterhalt eines langen Kontexts. Für den Endnutzer zählt noch etwas anderes: dass die Gewichte offengelegt werden, sodass man die Ergebnisse nicht auf Treu und Glauben hinnehmen muss.

Kommentare 0

Quellen

2
  1. 016 天烧光 2000 多万,拿下开源第一!小米史无前例「炼丹直播」收官 (量子位)ZH
  2. 02小米公开 MiMo-V3 核心架构 HySparse2 (IT之家, tag AI)ZH

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.