Otwarte wagi to nie open source, a różnica zaczyna być widoczna
Niemal każde wydanie opatrzone etykietą otwartego modelu daje wagi do pobrania i nic więcej. The Register przekonywał 15 września, że ta etykieta jest naciągana, a raport Mozilli opublikowany dzień wcześniej podał twarde liczby na to, co dają obie kategorie.

Wagi to wyuczone parametry liczbowe, które powstają w trakcie treningu. Same w sobie pozwalają uruchomić model, hostować go u siebie, dostroić na wewnętrznych dokumentach i pominąć API dostawcy. To realna wartość. Open Source Initiative widzi w nich jednak tylko „ułamek informacji potrzebnych do pełnej rozliczalności”.
Steven J. Vaughan-Nichols z The Register przekonywał 15 września, że branża po cichu podmieniła jedno słowo na inne. Firma publikuje pliki modelu na Hugging Face, deweloperzy uruchamiają je na własnych GPU, a wydanie od razu nazywane jest modelem open source. Jego zdaniem niekoniecznie. Może to być tylko model z otwartymi wagami.
To rozróżnienie brzmi akademicko. Akademickie nie jest.
Bez danych treningowych i szczegółowej dokumentacji osoby z zewnątrz nie ustalą, jakie źródła weszły do modelu, jaki materiał objęty prawem autorskim lub prywatny mógł zostać wykorzystany, jak filtrowano dane, które języki były niedoreprezentowane, czy dane benchmarkowe wyciekły do treningu ani jaką pracę nad dopasowaniem wykonano po pretreningu. James Landay, dyrektor Stanford Institute for Human-Centered AI, powiedział The Register, że otwarte wagi są postępem, bo pozwalają trzymać model poza cudzym pipeline'em danych. Dodał jednak: „Nadal nie widzisz, jak to zbudowano, na czym trenowano ani dlaczego zachowuje się tak, jak się zachowuje. To nie jest otwarty model. To otwarta dystrybucja”.
Open Source Initiative próbowała rozstrzygnąć spór definicją Open Source AI, OSAID 1.0, opublikowaną w październiku 2024. Wymaga ona, by parametry modelu, w tym wagi, były dostępne na warunkach zatwierdzonych przez OSI, ale nie wskazuje konkretnego mechanizmu prawnego. Ta luka się nie zamknęła. Luca Antiga, CTO Lightning AI, nazwał potraktowanie wag „dziurą, przez którą licencje będą mniej skuteczne”. Bruce Perens, autor pierwotnej definicji open source, potępił OSAID w 2024 i później stwierdził, że sama OSI uczestniczy teraz w openwashingu. Bradley Kuhn z Software Freedom Conservancy i Richard Fontana z Red Hata wezwali do uchylenia definicji.
Co właściwie dają wagi
Mozilla opublikowała 15 września wersję 1.1 swojego raportu State of Open Source AI, na danych aktualnych do 1 września. To pożyteczna kontrola rzeczywistości dla obu stron sporu. Najlepszy otwarty model tracił trzy punkty do zamkniętego lidera w Artificial Analysis Intelligence Index przy 60% ceny, a do Claude Fable 5 dwa punkty przy 30%. Mozilla dopasowała dane METR o horyzoncie zadań i oszacowała lukę otwarte-zamknięte na około 4,4 miesiąca, blisko czteromiesięcznego szacunku Epoch AI. Zdolności otwartych modeli podwajają się co 3,9 miesiąca, zamkniętych co 5,5, według wyliczeń Mozilli.
Mozilla jest orędownikiem otwartych modeli, a raport nie jest neutralny. TIME podał 14 lipca, że CTO Mozilli Raffi Krikorian określił go jako częściowo rzeczniczy. Same liczby z raportu też podważają nagłówek. Raport liczy 16 godnych uwagi otwartych wydań i żadne nie dostarcza przepisu na dane, którego wymaga definicja OSI. Czteromiesięczna luka i wynik 30% ceny są mierzone API do API na hostowanych endpointach w cenie katalogowej.
Do tego dochodzi sprzęt. Wykres Mozilli umieszcza najlepszy otwarty model mieszczący się na jednym serwerze na 52,6, a najlepszy mieszczący się na jednym GPU na 40, spadki o 10 i 23 punkty. Natywny checkpoint MXFP4 Kimi K3 zajmuje około 1,56 TB w 96 shardach. Konfiguracja serwowania wymienia 64 lub więcej akceleratorów, a vLLM wymaga co najmniej ośmiu GPU GB300 i wielu węzłów dla ruchu produkcyjnego. Sama Mozilla nazywa to otwartym, ale nierunowalnym dla większości tych, którzy go mają. Jeden wyjątek: Inkling-Small od Thinking Machines, na licencji Apache 2.0, mieści się na pojedynczym B300 przy minimum 180 GB.
Krikorian powiedział Ars Technica w mailu, że wybór płacenia za modele zamknięte wygląda na zależny od obciążenia, a nie od organizacji. Pieniądze to potwierdzają. Zamknięci dostawcy wzięli 96% przychodów na poziomie modeli na OpenRouter od maja do września 2025, według Linux Foundation. Mozilla naliczyła tymczasem osiem z dziesięciu najlepszych modeli według wolumenu tokenów do sierpnia jako otwarte wagi, siedem z nich zbudowanych w Chinach.
Ten ostatni szczegół ma znaczenie dla sporu o licencje. Dane Mozilli kończą się na 1 września, a Artificial Analysis przeniosło od tego czasu swój indeks na v4.3 z innym zestawem ewaluacyjnym, więc naniesione liczby nie są już bezpośrednio porównywalne z bieżącą tablicą. Podpis Mozilli pod własnym wykresem brzmi: „luka resetuje się w każdym cyklu wydawniczym”. Opóźnienie 4,4 miesiąca to migawka, nie linia trendu.
Wątek praw autorskich to miejsce, w którym brakująca dokumentacja staje się kosztowna. Praca A. Feder Cooper, Marka A. Lemleya i współautorów, opublikowana na arXiv i poprawiona 20 lipca 2026, objęła ponad 3 000 eksperymentów na 200 książkach i 14 modelach LLM z otwartymi wagami. Większość modeli nie zapamiętała większości książek w całości ani częściowo. Ale Llama 3.1 70B zapamiętała całkowicie niektóre tytuły, w tym Harry Potter i Kamień Filozoficzny, tak dalece, że całą książkę można wyciągnąć niemal dosłownie z jej pierwszych słów. Autorzy twierdzą, że wynik nie faworyzuje żadnej strony w sądzie.
Spór o etykietę nie jest więc semantyczny. Jeśli nie widzisz danych, nie zaudytujesz tego, co model zapamiętał, i nie odtworzysz systemu, który go wytworzył. Ujęcie Landaya jest najczystsze z dostępnych. Otwarte wagi odpowiadają na pytanie, czy możesz to uruchomić. Open source odpowiada na pytanie, czy możesz temu zaufać, ulepszyć to i zbudować na tym następną rzecz.
Źródła
3- 01Open weights are not open source: Why AI's favorite label is under disputeEN
- 02China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 03Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.