Co naprawdę znaczy open weights i co modele wciąż ukrywają
Wydania z otwartymi wagami pozwalają każdemu pobrać parametry modelu, ale raport Mozilli z 15 września twierdzi, że najlepszy otwarty model wciąż zostaje za zamkniętym liderem o jakieś cztery miesiące. Open Source Initiative przekonuje z kolei, że etykieta obejmuje znacznie mniej niż cztery wolności oprogramowania.

"Open weights" to dziś hasło marketingowe w równym stopniu co techniczne. Prosta wersja: wytrenowane parametry modelu są publikowane jako pliki, które można pobrać, uruchomić i dostroić. To wszystko. Nic nie mówi o danych, z których model się uczył, o kodzie, który go trenował, ani o licencji, którą do niego dołączono.
Rozróżnienie ma znaczenie, bo termin pojawia się w sporach politycznych, decyzjach zakupowych i coraz częściej w argumentach o bezpieczeństwie narodowym. Warto więc oddzielić to, co daje wydanie z otwartymi wagami, od tego, co zatrzymuje.
Test czterech wolności
Open Source Initiative, która utrzymuje definicję używaną przez większość branży software'owej, przedstawiła swoje stanowisko we wpisie na blogu z 19 września. Modele AI mają trzy główne składniki: dane treningowe, wagi czyli parametry oraz kod do przygotowania danych i treningu. To, do którego z nich masz dostęp, decyduje o tym, czy model jest zamknięty, z otwartymi wagami, czy Open Source AI.
Otwarte wagi dają ci jeden z trzech. Możesz uruchomić model lokalnie i płacić tylko za prąd i sprzęt albo przekazać go zewnętrznemu dostawcy. Możesz dostroić go na własnych danych. To więcej swobody niż oferuje w pełni zamknięty system, gdzie korzystasz z infrastruktury dostawcy i płacisz jego stawki.
Modele z otwartymi wagami ograniczają twoją możliwość modyfikowania modelu, a w pełni go zbadać nie możesz.
Argument OSI jest taki, że to za mało, żeby spełnić cztery wolności oprogramowania: używania, badania, modyfikowania i udostępniania bez pytania właściciela praw o zgodę. Bez kodu treningowego i bez zbioru danych albo szczegółowego opisu, jak model powstał, nie sprawdzisz, dlaczego daje taki, a nie inny wynik. Organizacja wskazuje Olmo od Ai2 jako kontrprzykład: duży model językowy wydany z pełnym zbiorem danych treningowych i checkpointami. Dzięki temu badacze mogli wstrzyknąć nowe informacje do danych treningowych i obserwować, jak model je zapamiętał lub zapomniał.
Taki eksperyment to praktyczna różnica między obiema etykietami. Zdaniem OSI to także różnica między możliwością zweryfikowania modelu a koniecznością wiary komuś na słowo.
Luka i sposób jej pomiaru
Mozilla opublikowała wersję 1.1 swojego raportu State of Open Source AI 15 września, na danych aktualnych do 1 września, jak podaje Tom's Hardware. Główny wniosek: najlepszy otwarty model zostawał za zamkniętym liderem w Artificial Analysis Intelligence Index o trzy punkty, przy 60% ceny, i plasował się dwa punkty za Claude Fable 5 przy 30% kosztu.
Dopasowanie Mozilli do danych METR o horyzoncie zadań daje lukę otwarte-zamknięte na około 4,4 miesiąca, zgodnie z czteromiesięcznym szacunkiem Epoch AI. METR, organizacja non-profit zajmująca się badaniami, ocenia modele po długości zadania, mierzonej czasem pracy człowieka, które kończą w połowie przypadków. Według szacunku Mozilli zamknięte modele radzą sobie z zadaniami zajmującymi ekspertom od 8 do 12 godzin; otwarte modele osiągają ten poziom około cztery miesiące później. Mozilla wylicza, że możliwości otwartych modeli podwajają się co 3,9 miesiąca, a zamkniętych co 5,5 miesiąca.
Raport nie jest neutralnym dokumentem i Tom's Hardware to przyznaje. Mozilla to non-profit stojąca za Firefoksem i orędownik otwartych modeli. TIME podał 14 lipca, że dyrektor techniczny Mozilli Raffi Krikorian określił raport jako częściowo rzecznictwo. Powstał na podstawie ankiety Mozilla/SlashData wśród około 1 400 programistów, danych o ruchu z OpenRoutera i zewnętrznych indeksów benchmarkowych. Wymienia 16 godnych uwagi otwartych wydań, z których żadne nie dostarcza przepisu na dane wymaganego przez definicję OSI.
Jest jeszcze kilka zastrzeżeń wartych pamięci. Liczba czterech miesięcy i porównanie ceny tokenów na poziomie 30% są mierzone API do API na hostowanych endpointach, w cenie katalogowej. Własny wykres sprzętowy Mozilli opowiada ostrzejszą historię: najlepszy otwarty model mieszczący się na jednym serwerze ma 52,6, a najlepszy mieszczący się na jednej karcie GPU ma 40, czyli spadki o 10 i 23 punkty od szczytu. Natywny checkpoint Kimi K3 w MXFP4 zajmuje około 1,56TB na 96 shardach, a konfiguracja serwowania Mozilli wymienia 64 lub więcej akceleratorów. vLLM wymaga z kolei co najmniej ośmiu GPU GB300 w wielu węzłach do obsługi ruchu produkcyjnego. Raport opisuje to jako otwarte, ale nierunowalne dla większości tych, którzy je mają.
Co faktycznie robi rynek
Wdrożenia i przychody wskazują w różnych kierunkach. Na OpenRouterze, rynku kierującym ruch programistów do setek modeli, Mozilla naliczyła osiem z dziesięciu najpopularniejszych modeli według wolumenu tokenów w sierpniu jako otwarte wagi, siedem z nich chińskiej produkcji. Jednak zamknięci dostawcy zgarnęli 96% przychodów na poziomie modeli na OpenRouterze między majem a wrześniem 2025 roku, według Linux Foundation.
"Decyzję o płaceniu za zamknięte [modele] postrzegamy jako zależną od obciążenia, a nie od organizacji" powiedział Krikorian w mailu do Ars Technica.
Obraz benchmarków zmienia się dość szybko, żeby komplikować każde statyczne porównanie. Dane Mozilli kończą się 1 września. Od tego czasu Artificial Analysis przeniosła swój indeks na v4.3 z innym zestawem ewaluacyjnym; bieżąca tablica pokazuje Claude Fable 5.1 na 53 przy najwyższym ustawieniu wysiłku, z Kimi K3 na 44. Według Tom's Hardware te liczby nie są porównywalne z wartościami v4.1.1, które naniosła Mozilla. Tablica vals.ai Terminal-Bench 2.1, zaktualizowana 11 września, jest prowadzona przez GPT-6 Astra z 87,27%, z Fable 5.1 na 85,02%. Podpis Mozilli pod własnym wykresem brzmi: "luka resetuje się co cykl wydawniczy".
W dyskusji o Kimi K3 przewija się jeszcze jeden wątek. Modelowi towarzyszy zarzut szczegółowo opisany we wspólnym advisory NSA/CISA/FBI AA26-251A z 8 września, który raport Mozilli podaje jako "twierdzony, ale nieudowodniony": że Moonshot wyekstrahował dane Claude Fable 5 do treningu K3 przez destylację, czyli trenowanie jednego modelu na wynikach innego. 17 lipca Artificial Analysis miała K3 na 57 przeciwko 60 dla Fable 5; do 1 września Mozilla miała go dwa punkty z tyłu.
Dlaczego trwa spór o etykietę
Zarówno OSI, jak i Mozilla argumentują za większą otwartością, z różnych stron. OSI chce, żeby termin "open source" był zarezerwowany dla wydań zawierających wszystkie trzy składniki, bo pytania o zaufanie i weryfikację stają się trudniejsze w miarę rozprzestrzeniania się AI w codziennym życiu. Mozilla chce, żeby mierzone możliwości otwartych modeli brano poważnie, przyznając jednocześnie, że wiodących modeli nie uruchomi większość tych, którzy mogą je pobrać.
Dla każdego, kto czyta kartę modelu, praktyczny wniosek jest wąski i sprawdzalny. Sprawdź, czy wagi da się pobrać, jaka licencja nimi rządzi, czy dołączono kod treningowy albo dokumentację danych i jakiego sprzętu ta rzecz faktycznie wymaga. Hasło na górze strony nie odpowie na żadne z tych pytań.
Źródła
2- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.