Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Pół roku chińskich modeli open source: MiMo od Xiaomi, DeepSeek i modele na Hugging Face

Xiaomi pokazało na żywo, jak trenuje duży model metodą uczenia ze wzmocnieniem. MiMo-V2.6-Pro ma 1,02 bln parametrów i 42 mld aktywnych, a w rankingu modeli otwartych zajął pierwsze miejsce. DeepSeek w tym samym czasie udostępnił eksperymentalną wersję modelu wizyjnego na licencji MIT.

AI i modeleAnalizaMarta ZielińskaOpublikowano: 23 września 20266 min czytaniaŹródła 3
Pół roku chińskich modeli open source: MiMo od Xiaomi, DeepSeek i modele na Hugging Face

W ostatnim półroczu rywalizacja chińskich modeli open source wyraźnie przyspieszyła. 22 września Xiaomi zakończyło trwającą sześć dni transmisję z treningu. Uczenie ze wzmocnieniem dużego modelu prowadzono na żywo, w studiu. Rachunek zamknął się kwotą 3,5 mln dolarów, czyli około 23,44 mln juanów.

Opublikowano także wyniki modelu. MiMo-V2.6-Pro ma 1,02 bln parametrów i 42 mld aktywnych, a w Artificial Analysis Intelligence Index zdobył 46 punktów. To dało mu pierwsze miejsce wśród modeli otwartych. Luo Fuli, która odpowiada za MiMo, nazwała ten trening jednym z największych pojedynczych treningów uczenia ze wzmocnieniem, jakie przeprowadził zespół modelu open source. Powiedziała też wprost, że wyzwania badawcze i inżynieryjne były większe niż w DeepSeek-R1, w którym wcześniej uczestniczyła.

Ważniejsza jest generalizacja poza zbiorem treningowym. W DeepSWE v1.1, który sprawdza Coding Agenta, Pro podniósł wynik z 58,4 do 72,57 punktu, a Flash z 48,7 do 65,68 punktu. Wystarczyło 30 kroków treningu, żeby model nie tylko stale się wzmacniał, ale też przeniósł swoje możliwości na zadania inżynierii oprogramowania, których wcześniej nie widział.

Cena nie poszła w górę razem z możliwościami. MiMo-V2.6 zachowuje cennik API z poprzedniej generacji: Pro kosztuje około 3 juanów za milion tokenów wejściowych i 6 juanów za wyjściowe, Flash około 1 juana i 2 juanów. Według wyliczeń Artificial Analysis średni koszt wykonania jednego zadania przez MiMo-V2.6-Pro to zaledwie 0,13 dolara. Zamknięty model Grok 4.7, wydany w tym samym okresie, ma na tym samym indeksie również 46 punktów, ale jego wersja o wyższej konfiguracji potrzebuje na jedno zadanie średnio 3,74 dolara.

Lista otwartych zasobów też się wydłuża. Xiaomi udostępniło wagi modelu, raport techniczny, ponad 7000 środowisk zadań RL, framework do treningu end-to-end oraz mini-harness, który można dowolnie składać. Do tego wypuściło model destylowany, zbudowany na bazie Qwen3.5-9B i poddany nadzorowanemu dostrajaniu na danych wygenerowanych przez MiMo. Były badacz Hugging Face zwrócił uwagę na tempo: od startu finalnego treningu RL do oddania modelu i frameworku minęło mniej niż tydzień.

DeepSeek natomiast 31 sierpnia umieścił na Hugging Face pierwszy multimodalny model z serii V4, DeepSeek-V4-Flash-Vision-Exp, na licencji MIT. Udostępnione materiały obejmują pliki modelu, Tokenizer, referencyjną implementację Prompt Encoding oraz minimalną implementację wnioskowania w PyTorch. Obecność chińskich modeli w społeczności open source staje się coraz mocniejsza.

Komentarze 0

Źródła

3
  1. 016 天烧光 2000 多万,拿下开源第一!小米史无前例炼丹直播收官ZH
  2. 02DeepSeek-V4-Flash-Vision-Exp 模型已开源ZH
  3. 03DeepSeek-V4.1-Flash 模型卡EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.