Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Xiaomi trenowało model na żywo i wydało 3,5 mln dolarów w sześć dni

MiMo-V2.6-Pro ma 1,02 bln parametrów i 42 mld aktywnych. W otwartym treningu na żywo zdobył 46 punktów w indeksie Artificial Analysis i pierwsze miejsce wśród modeli otwartych.

AI i modeleNewsMarta ZielińskaOpublikowano: 23 września 20265 min czytaniaŹródła 2
Xiaomi trenowało model na żywo i wydało 3,5 mln dolarów w sześć dni

Xiaomi zrobiła z treningu modelu publiczne widowisko. Przez sześć dni prowadziła transmisję z uczenia ze wzmocnieniem, na której licznik wydatków rósł w czasie rzeczywistym. Jak relacjonuje chiński portal 量子位, oba modele, MiMo-V2.6-Pro i MiMo-V2.6-Flash, ukończyły po 30 kroków treningowych. Końcowy rachunek zatrzymał się na 3,5 mln dolarów, czyli około 23,44 mln juanów.

Rozbicie kosztów pokazuje, ile kosztuje dziś uczenie ze wzmocnieniem na dużą skalę. Sam Pro potrzebował 5 dni i 3 godzin oraz około 2,6 mln dolarów. Flash potrzebował 3 dni i 10 godzin, a kosztował około 0,9 mln dolarów. Każdy krok zawierał 1568 promptów, a na każde zadanie model próbował 16 różnych ścieżek, co dawało ponad 25 tys. przebiegów na krok. Przy 2,7–3,7 mld tokenów treningowych na krok sam Pro przetworzył w całym treningu około 81–111 mld tokenów. Jak policzył portal, to objętość ponad 80 tys. okien kontekstu o długości miliona tokenów.

Wynik i porównanie z frontierem

MiMo-V2.6-Pro ma 1,02 bln parametrów, z czego 42 mld aktywnych, i zdobył 46 punktów w indeksie inteligencji Artificial Analysis. Zajął pierwsze miejsce wśród modeli otwartych. W większości testów agentowych wynik Pro zbliża się do Claude Opus 5 i GPT-5.6 Sol. Szefowa projektu MiMo, 罗福莉, wcześniej zaangażowana w prace nad DeepSeek-R1, nazwała to jednym z największych pojedynczych treningów ze wzmocnieniem, jakie przeprowadził zespół dowolnego otwartego modelu. Dodała, że wyzwanie inżynieryjne przewyższyło to, które pamięta z DeepSeek-R1.

Otwartość jako strategia, nie gest

Równolegle Xiaomi publikuje szczegóły architektury. MiMo-V3 opiera się na rozwiązaniu HySparse2, zoptymalizowanym pod długie, wieloetapowe zadania agentowe: dwupoziomowe współdzielenie KV, rzadki wybór tokenów i wcześniejsze wyjście z fazy wstępnej. Nakład obliczeniowy fazy wstępnej spada do jednej piątej wartości rozwiązania HySparse z hybrydowym oknem uwagi, a KV cache zmniejsza się z 12 GB do 2,7 GB przy kontekście miliona tokenów. Według Xiaomi zdolność wyszukiwania w długich tekstach nie spada, lecz rośnie.

To ten sam kierunek, który widać w rodzinie DeepSeek: modele chińskie konkurują dziś nie szczytem parametrów, a kosztem utrzymania długiego kontekstu. Dla odbiorcy końcowego znaczenie ma coś jeszcze: wagi są otwierane, więc wyników nie trzeba przyjmować na wiarę.

Komentarze 0

Źródła

2
  1. 016 天烧光 2000 多万,拿下开源第一!小米史无前例「炼丹直播」收官 (量子位)ZH
  2. 02小米公开 MiMo-V3 核心架构 HySparse2 (IT之家, tag AI)ZH

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.