Raport Mozilli: najlepsze chińskie modele open-weight około 4,4 miesiąca za amerykańską czołówką
Najlepsze chińskie modele open-weight tracą do amerykańskich modeli czołowych około 4,4 miesiąca. Tak wynika z wersji 1.1 raportu Mozilli State of Open Source AI, opublikowanej 15 września na danych aktualnych do 1 września.

Mozilla dopasowała dane METR o horyzoncie zadań i wyszła jej luka między modelami otwartymi i zamkniętymi na około 4,4 miesiąca. To zgadza się z czteromiesięcznym szacunkiem Epoch AI. Tom's Hardware napisał o tym 16 września. METR to organizacja badawcza non profit, która ocenia modele według długości zadania, liczonej w ludzkim czasie pracy. Chodzi o zadania, które model kończy w połowie przypadków.
Według dopasowanego szacunku Mozilli modele zamknięte radzą sobie z zadaniami, które zajmują ekspertom od 8 do 12 godzin. Modele otwarte dochodzą do tego około cztery miesiące później. Mozilla wyliczyła, że ich możliwości podwajają się co 3,9 miesiąca, a w przypadku modeli zamkniętych co 5,5 miesiąca.
Raport jest cykliczną oceną, opublikowaną po raz pierwszy 14 lipca na blogu Mozilli. Powstał na podstawie ankiety Mozilla/SlashData wśród około 1 400 deweloperów, danych o ruchu z OpenRoutera oraz zewnętrznych wskaźników benchmarkowych. Mozilla działa na rzecz modeli otwartych, a TIME podał 14 lipca, że Raffi Krikorian, dyrektor techniczny Mozilli, określił raport jako częściowo rzeczniczy.
„Open weights” oznacza w tym kontekście wagi do pobrania, a nie dane treningowe czy kod. Raport odnotowuje 16 godnych uwagi wydań otwartych, ale żadne nie dostarcza przepisu na dane wymaganego przez definicję Open Source Initiative.
Benchmarki i ceny opowiadają różne historie
Najlepszy model otwarty tracił do zamkniętego lidera w Artificial Analysis Intelligence Index trzy punkty przy 60% ceny. Do Claude Fable 5 tracił dwa punkty przy 30% ceny. Tak odczytał raport Tom's Hardware.
Mozilla przedstawiła też wyniki Terminal-Bench 2.1 od vals.ai. Każdy model przechodzi tam przez ten sam harness, czyli warstwę oprogramowania, która udostępnia modelowi jego narzędzia. Na tej liście GLM-5.2 od Z.ai zdobył wynik w granicach punktu od Claude Opus 4.7 i około czterech punktów za Opus 4.8, przy koszcie poniżej jednej piątej ceny za test.
Na OpenRouterze, rynku kierującym ruch deweloperów do setek modeli, Mozilla naliczyła osiem z dziesięciu najpopularniejszych modeli według wolumenu tokenów w sierpniu jako open weights. Siedem z nich zbudowano w Chinach. Dostawcy zamknięci wzięli jednak 96% przychodów na poziomie modeli na OpenRouterze od maja do września 2025 roku, podała Linux Foundation.
„Decyzję o płaceniu za modele zamknięte postrzegamy jako zależną od obciążenia, a nie od organizacji” powiedział Krikorian w mailu do Ars Technica.
Podpis Mozilli pod własnym wykresem jest bez ogródek szczery co do trwałości liczby z nagłówka: „luka resetuje się w każdym cyklu wydawniczym”.
Czteromiesięczna liczba ma zastrzeżenia
Jedno zastrzeżenie jest takie, że czteromiesięczna luka i liczba 30% ceny tokenów są mierzone API do API na hostowanych endpointach i w cenie katalogowej. Własny wykres sprzętowy raportu daje najlepszemu modelowi mieszczącemu się na jednym serwerze 52,6, a najlepszemu na jednym GPU 40. Spadek od szczytu to odpowiednio 10 i 23 punkty, czyli luka większa niż raportowane cztery miesiące.
Drugi haczyk to wymagania serwowania. Natywny checkpoint MXFP4 modelu Kimi K3 zajmuje około 1,56 TB na 96 shardach. Konfiguracja serwowania Mozilli wymienia 64 lub więcej akceleratorów, a vLLM wymaga co najmniej ośmiu GPU GB300, z wieloma węzłami dla ruchu produkcyjnego.
Raport opisuje to jako otwarte, ale nie do uruchomienia dla większości tych, którzy to mają. Tom's Hardware oszacował zapotrzebowanie na pamięć na blisko 1,5 TB w lipcu.
Jednym wyjątkiem jest model Inkling-Small od Thinking Machines na licencji Apache 2.0. Jego wersja NVFP4 mieści się na jednym B300 przy minimum 180 GB.
Przy jednym z modeli jest też spór o pochodzenie. K3 wiąże się z zarzutem opisanym we wspólnym advisory NSA/CISA/FBI z 8 września (AA26-251A). Twierdzenie, które raport Mozilli określa jako „podnoszone i nieudowodnione”, mówi, że Moonshot wydobył dane Claude Fable 5 do trenowania K3 przez destylację. Destylacja to trenowanie jednego modelu na wynikach innego.
Dane Mozilli kończą się 1 września. Od tego czasu Artificial Analysis przeniosło swój indeks na v4.3 z innym zestawem ewaluacyjnym. Aktualna tablica ma Claude Fable 5.1 na 53 przy najwyższym ustawieniu wysiłku, a Kimi K3 na 44. Te liczby nie są porównywalne z v4.1.1, które naniosła Mozilla. Tablica Terminal-Bench 2.1 od vals.ai, zaktualizowana 11 września, ma teraz na czele GPT-6 Astra z 87,27%, a Fable 5.1 z 85,02%.
Dla kontekstu, jak szybko te rankingi się zmieniają: 17 lipca Artificial Analysis miało K3 na 57 wobec 60 dla Fable 5, a 1 września Mozilla miała je dwa punkty z tyłu.
Spór o definicję pod liczbami
Mozilla mierzy lukę w możliwościach, a Open Source Initiative przekonuje, że branża mierzy niewłaściwą rzecz. We wpisie na blogu z 19 września prezes OSI (niepodpisany w poście) napisał, że open weights pozwalają użytkownikom korzystać z części czterech wolności oprogramowania. Chodzi o wolność używania, badania, modyfikowania i udostępniania bez pytania właściciela praw o zgodę. Nie ze wszystkich i tylko w pewnym stopniu.
Modele AI składają się z trzech głównych części, jak podaje OSI: danych treningowych, wag i parametrów oraz kodu do przygotowania danych i treningu. To, czy użytkownik ma dostęp do tych części, decyduje o tym, czy model jest zamknięty, open-weight czy Open Source. Wydania open-weight udostępniają wagi. Dzięki temu można uruchomić model lokalnie, zapłacić stronie trzeciej za hostowanie albo dostroić go na własnych danych. Nie udostępniają kodu ani danych treningowych.
OSI przyznaje, że open weights dają więcej wyboru niż całkowicie zamknięte systemy, takie jak ChatGPT, Claude i wiele systemów jazdy autonomicznej. Jej zastrzeżenie dotyczy weryfikacji. Bez kodu i danych treningowych, argumentuje OSI, nie można w pełni zbadać modelu, żeby wyjaśnić wynik albo potwierdzić, że można mu zaufać.
Wpis podaje Olmo od Ai2 jako przykład surowszej kategorii. Badacze użyli pełnego zbioru danych treningowych i checkpointów modelu, żeby wstrzyknąć nowe informacje do danych treningowych, a potem obserwować, jak model je zapamiętał lub zapomniał, napisało OSI. Takie badanie, przekonuje organizacja, jest możliwe tylko przy wydaniu Open Source AI.
Rozróżnienie nie jest akademickie. Raport Mozilli odnotowuje 16 godnych uwagi wydań otwartych i nie znajduje żadnego, które dostarcza przepis na dane wymagany przez Open Source Initiative.
Małe modele, wąskie zadania
Z dala od sporu o czołówkę część wydań open-weight jest celowo mała i jednofunkcyjna. Superwhisper opublikował S1-mini, normalizator tekstu o 421 000 000 parametrów dla wyników rozpoznawania mowy, według jego karty modelu na Hugging Face.
Model bierze surowy transkrypt ASR i przepisuje go na czysty tekst pisany. Wypełniacze usuwa, fałszywe starty rozwiązuje na wartość, na której mówiący się zatrzymał, stosuje interpunkcję i wielkie litery, a liczby, daty, godziny, waluty i adresy e-mail wypowiedziane słownie zapisuje w formie pisanej.
Na wydzielonym zbiorze 7 519 angielskich przypadków osiąga 94,8% dokładności tokenów, a skwantyzowana wersja to plik 462 MiB, który działa na procesorze laptopa. Jest dostrojony z Qwen/Qwen3-0.6B i ma licencję Apache 2.0 oraz klauzulę nazewniczą. Karta modelu wyraźnie mówi, że to nie jest model konwersacyjny i nie będzie wykonywać ogólnych instrukcji.
Podobny wzorzec pojawia się w opisie wdrożenia z 22 września autorstwa Jamesa Cruce'a na ASTGL. Zastąpił deterministyczny router modelem Laya, otwartym modelem decyzji typowanych o około 421 000 000 parametrów. Laya zbudowano na enkoderze ModernBERT-large z limitem 1 024 tokenów i serwowano przez API tylko na loopbacku na Mac Studio z M3 Ultra i 256 GB pamięci zunifikowanej.
Wybrał go zamiast Jev od TypeSafe, hostowanej usługi we wczesnym dostępie, która podaje 0,042 dolara za milion tokenów wejściowych bez opłaty za tokeny wyjściowe i obsługuje wybory do 255 opcji. Chciał, żeby rutynowe decyzje zostawały na jego maszynie. Cruce jest ostrożny co do tego, co pokazuje wynik: model pobił jego deterministyczny router na zamrożonym odtworzeniu, ale nie testował, czy Laya ogólnie bije Jev.
Wskazuje też ograniczenie, które dotyczy każdej liczby w raporcie Mozilli. Karta modelu ostrzega, że Laya jest nadmiernie pewna siebie i wymaga kalibracji pod konkretną dziedzinę. Typowana odpowiedź, pisze, może być strukturalnie doskonała i faktycznie błędna.
Źródła
4- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
- 03S1-mini, Superwhisper's first open-weights language modelEN
- 04Local Laya vs Hosted Jev: Why My Agents Make Typed Decisions on My MacEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.