Xiaomi trenowało model na żywo i wydało 3,5 mln dolarów w sześć dni
MiMo-V2.6-Pro ma 1,02 bln parametrów i 42 mld aktywnych. W otwartym treningu na żywo zdobył 46 punktów w indeksie Artificial Analysis i pierwsze miejsce wśród modeli otwartych.

Xiaomi zrobiła z treningu modelu publiczne widowisko. Przez sześć dni prowadziła transmisję z uczenia ze wzmocnieniem, na której licznik wydatków rósł w czasie rzeczywistym. Jak relacjonuje chiński portal 量子位, oba modele, MiMo-V2.6-Pro i MiMo-V2.6-Flash, ukończyły po 30 kroków treningowych. Końcowy rachunek zatrzymał się na 3,5 mln dolarów, czyli około 23,44 mln juanów.
Rozbicie kosztów pokazuje, ile kosztuje dziś uczenie ze wzmocnieniem na dużą skalę. Sam Pro potrzebował 5 dni i 3 godzin oraz około 2,6 mln dolarów. Flash potrzebował 3 dni i 10 godzin, a kosztował około 0,9 mln dolarów. Każdy krok zawierał 1568 promptów, a na każde zadanie model próbował 16 różnych ścieżek, co dawało ponad 25 tys. przebiegów na krok. Przy 2,7–3,7 mld tokenów treningowych na krok sam Pro przetworzył w całym treningu około 81–111 mld tokenów. Jak policzył portal, to objętość ponad 80 tys. okien kontekstu o długości miliona tokenów.
Wynik i porównanie z frontierem
MiMo-V2.6-Pro ma 1,02 bln parametrów, z czego 42 mld aktywnych, i zdobył 46 punktów w indeksie inteligencji Artificial Analysis. Zajął pierwsze miejsce wśród modeli otwartych. W większości testów agentowych wynik Pro zbliża się do Claude Opus 5 i GPT-5.6 Sol. Szefowa projektu MiMo, 罗福莉, wcześniej zaangażowana w prace nad DeepSeek-R1, nazwała to jednym z największych pojedynczych treningów ze wzmocnieniem, jakie przeprowadził zespół dowolnego otwartego modelu. Dodała, że wyzwanie inżynieryjne przewyższyło to, które pamięta z DeepSeek-R1.
Otwartość jako strategia, nie gest
Równolegle Xiaomi publikuje szczegóły architektury. MiMo-V3 opiera się na rozwiązaniu HySparse2, zoptymalizowanym pod długie, wieloetapowe zadania agentowe: dwupoziomowe współdzielenie KV, rzadki wybór tokenów i wcześniejsze wyjście z fazy wstępnej. Nakład obliczeniowy fazy wstępnej spada do jednej piątej wartości rozwiązania HySparse z hybrydowym oknem uwagi, a KV cache zmniejsza się z 12 GB do 2,7 GB przy kontekście miliona tokenów. Według Xiaomi zdolność wyszukiwania w długich tekstach nie spada, lecz rośnie.
To ten sam kierunek, który widać w rodzinie DeepSeek: modele chińskie konkurują dziś nie szczytem parametrów, a kosztem utrzymania długiego kontekstu. Dla odbiorcy końcowego znaczenie ma coś jeszcze: wagi są otwierane, więc wyników nie trzeba przyjmować na wiarę.
Źródła
2Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.