Pół roku chińskich modeli open source: MiMo od Xiaomi, DeepSeek i modele na Hugging Face
Xiaomi pokazało na żywo, jak trenuje duży model metodą uczenia ze wzmocnieniem. MiMo-V2.6-Pro ma 1,02 bln parametrów i 42 mld aktywnych, a w rankingu modeli otwartych zajął pierwsze miejsce. DeepSeek w tym samym czasie udostępnił eksperymentalną wersję modelu wizyjnego na licencji MIT.

W ostatnim półroczu rywalizacja chińskich modeli open source wyraźnie przyspieszyła. 22 września Xiaomi zakończyło trwającą sześć dni transmisję z treningu. Uczenie ze wzmocnieniem dużego modelu prowadzono na żywo, w studiu. Rachunek zamknął się kwotą 3,5 mln dolarów, czyli około 23,44 mln juanów.
Opublikowano także wyniki modelu. MiMo-V2.6-Pro ma 1,02 bln parametrów i 42 mld aktywnych, a w Artificial Analysis Intelligence Index zdobył 46 punktów. To dało mu pierwsze miejsce wśród modeli otwartych. Luo Fuli, która odpowiada za MiMo, nazwała ten trening jednym z największych pojedynczych treningów uczenia ze wzmocnieniem, jakie przeprowadził zespół modelu open source. Powiedziała też wprost, że wyzwania badawcze i inżynieryjne były większe niż w DeepSeek-R1, w którym wcześniej uczestniczyła.
Ważniejsza jest generalizacja poza zbiorem treningowym. W DeepSWE v1.1, który sprawdza Coding Agenta, Pro podniósł wynik z 58,4 do 72,57 punktu, a Flash z 48,7 do 65,68 punktu. Wystarczyło 30 kroków treningu, żeby model nie tylko stale się wzmacniał, ale też przeniósł swoje możliwości na zadania inżynierii oprogramowania, których wcześniej nie widział.
Cena nie poszła w górę razem z możliwościami. MiMo-V2.6 zachowuje cennik API z poprzedniej generacji: Pro kosztuje około 3 juanów za milion tokenów wejściowych i 6 juanów za wyjściowe, Flash około 1 juana i 2 juanów. Według wyliczeń Artificial Analysis średni koszt wykonania jednego zadania przez MiMo-V2.6-Pro to zaledwie 0,13 dolara. Zamknięty model Grok 4.7, wydany w tym samym okresie, ma na tym samym indeksie również 46 punktów, ale jego wersja o wyższej konfiguracji potrzebuje na jedno zadanie średnio 3,74 dolara.
Lista otwartych zasobów też się wydłuża. Xiaomi udostępniło wagi modelu, raport techniczny, ponad 7000 środowisk zadań RL, framework do treningu end-to-end oraz mini-harness, który można dowolnie składać. Do tego wypuściło model destylowany, zbudowany na bazie Qwen3.5-9B i poddany nadzorowanemu dostrajaniu na danych wygenerowanych przez MiMo. Były badacz Hugging Face zwrócił uwagę na tempo: od startu finalnego treningu RL do oddania modelu i frameworku minęło mniej niż tydzień.
DeepSeek natomiast 31 sierpnia umieścił na Hugging Face pierwszy multimodalny model z serii V4, DeepSeek-V4-Flash-Vision-Exp, na licencji MIT. Udostępnione materiały obejmują pliki modelu, Tokenizer, referencyjną implementację Prompt Encoding oraz minimalną implementację wnioskowania w PyTorch. Obecność chińskich modeli w społeczności open source staje się coraz mocniejsza.
Źródła
3- 016 天烧光 2000 多万,拿下开源第一!小米史无前例炼丹直播收官ZH
- 02DeepSeek-V4-Flash-Vision-Exp 模型已开源ZH
- 03DeepSeek-V4.1-Flash 模型卡EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.