Open weights to nie open source: co debata o AI wciąż myli
Najnowszy raport Mozilli State of Open Source AI twierdzi, że najlepsze chińskie modele z otwartymi wagami odstają od amerykańskiej czołówki o około cztery miesiące. Open Source Initiative odpowiada, że otwarte wagi dają tylko część tego, co naprawdę oznacza open source.

Otwarte wagi to dziś najbardziej sporne pojęcie w polityce dotyczącej AI. Mozilla opublikowała 15 września wersję 1.1 raportu State of Open Source AI, opartą na danych aktualnych do 1 września. Główna teza: najlepsze modele z otwartymi wagami są mniej więcej cztery miesiące za amerykańską czołówką. Raport opisał Tom's Hardware 16 września. Autorzy dopasowali dane METR o horyzoncie zadań i oszacowali lukę między modelami otwartymi i zamkniętymi na około 4,4 miesiąca. To zgadza się z szacunkiem Epoch AI wynoszącym cztery miesiące.
Open Source Initiative nie kwestionuje tego, że otwarte wagi są przydatne. Kwestionuje nazwę. We wpisie na blogu z 19 września OSI rozdziela modele z otwartymi wagami, które udostępniają wagi i nic więcej, od Open Source AI, które udostępnia także kod użyty do trenowania modelu oraz albo dane treningowe, albo szczegółowy opis tego, jak te dane powstały. Tylko druga kategoria, przekonuje OSI, pozwala użytkownikom korzystać ze wszystkich czterech wolności oprogramowania: używania, badania, modyfikowania i dzielenia się bez pytania właściciela praw.
Czteromiesięczna luka i to, na czym się opiera
Liczba Mozilli jest węższa, niż brzmi. Raport liczy 16 otwartych wydań i żadne nie dostarcza przepisu na dane wymaganego przez definicję Open Source AI OSI. Czteromiesięczny wynik zmierzono API do API na hostowanych endpointach i w cenie katalogowej, według Tom's Hardware. Opisuje więc to, ile deweloper płaci dostawcy, a nie ile kosztuje uruchomienie modelu na własnym sprzęcie.
W Artificial Analysis Intelligence Index Mozilla ustaliła, że najlepszy otwarty model odstawał od zamkniętego lidera o trzy punkty przy 60% ceny, a od Claude Fable 5 o dwa punkty przy 30% ceny. Na tablicy Terminal-Bench 2.1 serwisu vals.ai, która przepuszcza każdy model przez ten sam zestaw narzędzi, GLM-5.2 od Z.ai zdobył wynik w granicach punktu od Claude Opus 4.7 i około cztery punkty za Opus 4.8, przy koszcie poniżej jednej piątej ceny za test. Na OpenRouter Mozilla naliczyła osiem z dziesięciu najlepszych modeli według wolumenu tokenów w sierpniu jako otwarte wagi, siedem z nich zbudowanych w Chinach. Zamknięci dostawcy nadal zgarnęli 96% przychodów na poziomie modeli na OpenRouter od maja do września 2025 roku, według Linux Foundation.
Jest jeszcze zastrzeżenie sprzętowe, ta część raportu, która podkopuje nagłówek. Własny wykres Mozilli stawia najlepszy otwarty model mieszczący się na jednym serwerze na 52,6, a najlepszy mieszczący się na jednym GPU na 40, czyli spadki o 10 i 23 punkty od szczytu. To szersza luka niż cztery miesiące. Rodzimy checkpoint MXFP4 modelu Kimi K3 zajmuje około 1,56TB na 96 fragmentach, a konfiguracja serwowania Mozilli wymienia 64 lub więcej akceleratorów. vLLM wymaga co najmniej ośmiu GPU GB300, z wieloma węzłami dla ruchu produkcyjnego. Sam raport opisuje to jako otwarte, ale nienadające się do uruchomienia przez większość tych, którzy to mają. Jeden wyjątek: Inkling-Small od Thinking Machines, na licencji Apache 2.0, którego wersja NVFP4 mieści się na jednym B300 przy minimum 180GB.
"Decyzję o płaceniu za zamknięte [modele] postrzegamy jako zależną od obciążenia, a nie od organizacji" - powiedział Raffi Krikorian, dyrektor techniczny Mozilli, w mailu do Ars Technica.
Mozilla jest organizacją rzeczniczą i sama to mówi. Tom's Hardware zauważa, że TIME doniósł 14 lipca, iż Krikorian opisał raport jako częściowo rzeczniczy. Raport opiera się na ankiecie Mozilli i SlashData wśród około 1 400 deweloperów oraz na danych o ruchu z OpenRouter i zewnętrznych indeksach benchmarków. Podpis Mozilli pod wykresem mówi wprost o ruchomym celu pod tym wszystkim: "luka resetuje się z każdym cyklem wydawniczym".
Dlaczego spór o definicję ma większe znaczenie niż benchmark
Argument OSI nie brzmi, że otwarte wagi są złe. Brzmi, że termin rozciągnięto na modele, które pozwalają dostrajać i hostować u siebie, zostawiając dane treningowe i kod treningowy zamknięte. Ta różnica ma znaczenie w debatach politycznych, gdzie otwarte wagi są często traktowane jako zastępnik otwartości, konkurencji i możliwości audytu.
"Modele z otwartymi wagami ograniczają twoją zdolność do modyfikowania modelu i nie możesz go w pełni zbadać" - stwierdza wpis OSI. Przykładem alternatywy dla organizacji jest Olmo, duży model językowy od Ai2 wydany z pełnym zbiorem danych treningowych i checkpointami modelu. Pozwoliły one badaczom wstrzyknąć nowe informacje do danych treningowych i obserwować, jak model je zapamiętywał lub zapominał.
Ten rodzaj badania to nie akademickie porządki. Osobna praca na arXiv, "Extracting memorized pieces of (copyrighted) books from open-weight language models", złożona w maju 2025 i poprawiana do lipca 2026, stosuje technikę ekstrakcji do 200 książek i 14 modeli LLM z otwartymi wagami w ponad 3 000 eksperymentów. Autorzy, wśród nich A. Feder Cooper, Mark A. Lemley i Percy Liang, ustalili, że większość modeli LLM nie zapamiętuje większości książek, ani w całości, ani w części, ale zdarzają się godne uwagi wyjątki. Llama 3.1 70B zapamiętuje w całości niektóre książki, podaje praca, w tym Harry'ego Pottera i Kamień Filozoficzny, do tego stopnia, że całą książkę można wyciągnąć niemal dosłownie, podając jako prompt kilka pierwszych słów.
Wniosek pracy jest celowo niezadowalający dla obu stron sporu o prawa autorskie: zapamiętywanie zależy od modelu i od książki, a wyniki nie przesądzają jednoznacznie na korzyść powodów ani pozwanych. Otwarte wagi były tym, co w ogóle umożliwiło ten pomiar. Zamkniętych modeli nie da się tak zbadać z zewnątrz.
Praktyczny obraz jest więc bardziej zagmatwany niż talking points obu obozów. Wydania z otwartymi wagami są konkurencyjne cenowo, a w niektórych benchmarkach mieszczą się w punkcie lub dwóch od czołówki. Jednocześnie są drogie w uruchomieniu na najwyższym końcu, nierówno udokumentowane i, według definicji OSI, nie są open source. Luka, którą mierzy Mozilla, jest realna, podobnie jak luka, którą opisuje OSI między udostępnieniem wag a udostępnieniem modelu, który naprawdę można zbadać.
Źródła
3- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
- 03Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.