Otwarte wagi, zamknięte przepisy: co pokazują praca o zapamiętywaniu i spór o licencje
Praca przyjęta na COLM 2026 sprawdziła, ile z 200 książek zapamiętało 14 modeli o otwartych wagach. Większość modeli nie odtwarza większości książek, ale Llamę 3.1 70B wystarczy podpowiedzieć pierwszymi słowami książki, żeby wypisała niemal dosłowny tekst niektórych tytułów. Wynik trafia w środek sporu o to, co ma znaczyć słowo „otwarty”.

Praca nosi tytuł Extracting memorized pieces of (copyrighted) books from open-weight language models, arXiv:2505.12546. Pierwszą wersję złożono 18 maja 2025, poprawki szły do 20 lipca 2026. Autorzy: A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho i Percy Liang. Tekst przyjęto na COLM 2026.
Autorzy mówią wprost, do czego się odnoszą: do sposobu argumentowania w procesach. Powodowie i pozwani w sprawach o prawa autorskie dotyczących generatywnej sztucznej inteligencji, czytamy w streszczeniu, „często formułują ogólnikowe, przeciwstawne twierdzenia o tym, w jakim stopniu duże modele językowe (LLM) zapamiętują chronione utwory z książek w danych treningowych”. Obie strony, piszą autorzy, „drastycznie upraszczają związek między zapamiętywaniem a prawem autorskim”.
Zbudowali więc metodę pomiaru i puścili ją na dużą skalę: 200 książek, 14 modeli o otwartych wagach, ponad 3000 eksperymentów. Główny wynik przeczy najmocniejszym tezom. „W odniesieniu do naszej konkretnej metodologii ekstrakcji stwierdzamy, że większość LLM nie zapamiętuje większości książek, ani w całości, ani w części”.
Potem wyjątki. Llama 3.1 70B „zapamiętuje w całości niektóre książki, na przykład Harry Potter i Kamień Filozoficzny”. Zapamiętywanie jest tam tak rozległe, że według streszczenia „można deterministycznie wyodrębnić całą książkę niemal dosłownie, używając pierwszych kilku słów jako początkowego promptu”. Wynik zależy od modelu i od książki, i o to chodzi: zapamiętywanie nie jest właściwością LLM w ogóle.
Czy to komukolwiek pomoże w sądzie, pozostaje otwarte. Streszczenie mówi, że wyniki „mają istotne znaczenie dla spraw o prawa autorskie, choć nie takie, które jednoznacznie faworyzowałoby którąkolwiek ze stron”.
Problem z etykietą
Modele z tego badania mają otwarte wagi. Można je pobrać. To nie to samo co otwarte źródło, i The Register przedstawił ten argument 15 września 2026 w tekście Stevena J. Vaughan-Nicholsa. Open Source Initiative, opiekun definicji otwartego oprogramowania, definiuje otwarte wagi jako „końcowe wagi i obciążenia wytrenowanej sieci neuronowej” i dodaje, że same wagi odsłaniają tylko „ułamek informacji potrzebnych do pełnej rozliczalności”.
James Landay, dyrektor Stanford Institute for Human-Centered AI, ujął to praktycznie w rozmowie z The Register: „Otwarte wagi to postęp. Możesz pobrać model, uruchomić go na własnej maszynie, trzymać go z dala od cudzego pipeline'u danych. Ale nadal nie widzisz, jak coś zbudowano, na czym to trenowano ani dlaczego zachowuje się tak, jak się zachowuje. To nie jest otwarty model. To otwarta dystrybucja”.
„Otwarte wagi odpowiadają na pytanie »Czy mogę to uruchomić?«. Otwarte źródło odpowiada na pytanie »Czy mogę temu zaufać, ulepszyć to i zbudować na tym coś następnego?«”.
Drugi cytat też jest Landaya, z tej samej kolumny The Register. Opisuje ona krytykę definicji Open Source AI Definition 1.0 ze strony Bruce'a Perensa, Bradleya Kuhna i Richarda Fontany. OSI przyznało przy publikacji OSAID 1.0 w październiku 2024, że definicja będzie się zmieniać. Mike Dolan z Linux Foundation zgłosił licencję Open Model, Data, and Weights. Jest w obiegu od 2025 roku, a wśród współtwórców wymienia się Amazon, Meta, IBM, Microsoft i Nvidię. Zgłoszenie spotkało się z zastrzeżeniami na liście dyskusyjnej OSI do przeglądu licencji.
Ma to znaczenie dla wyniku badania nad zapamiętywaniem. Jeśli nie widzisz danych treningowych, nie sprawdzisz niezależnie, które książki do nich trafiły. Wyodrębniony tekst zostaje jedynym dowodem na to, co z modelu wyszło.
Tanie, blisko i trudne do uruchomienia
Mozilla opublikowała wersję 1.1 raportu State of Open Source AI 15 września 2026, z danymi aktualnymi na 1 września, podaje Tom's Hardware. Mozilla to organizacja non-profit stojąca za Firefoksem i orędownik otwartych modeli. Raport opiera się na ankiecie Mozilli i SlashData wśród około 1400 deweloperów, danych o ruchu z OpenRoutera oraz zewnętrznych rankingach benchmarków. Autorzy liczą 16 godnych uwagi otwartych wydań, a Tom's Hardware zauważa, że żadne nie dostarcza przepisu na dane, którego wymaga definicja OSI.
Liczby o możliwościach: najlepszy otwarty model tracił do zamkniętego lidera trzy punkty w Artificial Analysis Intelligence Index przy 60% ceny, a do Claude Fable 5 dwa punkty przy 30%. Dopasowanie Mozilli do danych METR o horyzoncie zadań daje lukę otwarte-zamknięte około 4,4 miesiąca, blisko czteromiesięcznego szacunku Epoch AI. Możliwości otwartych modeli podwajają się co 3,9 miesiąca według wyliczeń Mozilli, wobec 5,5 miesiąca dla zamkniętych.
Zastrzeżenia znaczą tyle samo co nagłówek. Czteromiesięczna luka i wynik 30% są mierzone od API do API na hostowanych endpointach w cenie katalogowej. Własny wykres sprzętowy Mozilli umieszcza najlepszy otwarty model mieszczący się na jednym serwerze na poziomie 52,6, a najlepszy na jednym GPU na 40. To spadki o 10 i 23 punkty od szczytu, rozrzut szerszy, niż sugerują cztery miesiące. Natywny checkpoint Kimi K3 w MXFP4 zajmuje około 1,56 TB na 96 shardach. Konfiguracja serwowania Mozilli wymienia 64 lub więcej akceleratorów, a vLLM wymaga co najmniej ośmiu GPU GB300. Raport nazywa to otwartym, ale nie do uruchomienia dla większości tych, którzy to mają.
Po stronie popytu Mozilla naliczyła osiem z dziesięciu najlepszych modeli według sierpniowego wolumenu tokenów w OpenRouterze jako otwarte, siedem z nich chińskich. Zamknięci dostawcy nadal zgarnęli 96% przychodów na poziomie modeli w OpenRouterze od maja do września 2025, podaje Linux Foundation. CTO Mozilli Raffi Krikorian napisał w mailu do Ars Technica, że wybór płacenia za zamknięte modele wygląda na zależny od zadania, a nie od organizacji.
Jeszcze jeden wątek. Raport podaje jako „twierdzenie zgłoszone, ale nieudowodnione” zarzut ze wspólnego biuletynu NSA, CISA i FBI AA26-251A z 8 września, że Moonshot wyekstrahował dane Claude Fable 5 do trenowania Kimi K3 przez destylację. Nieudowodnione i nierozstrzygnięte.
Zestawione razem oba dokumenty opisują ten sam obiekt z dwóch różnych końców. Model można pobrać, dostroić i, w co najmniej jednym udokumentowanym przypadku, nakłonić promptem do odtworzenia powieści niemal dosłownie. Dane treningowe za nim pozostają nieudokumentowane, nieobjęte licencją open source, a przy największych checkpointach poza zasięgiem sprzętu, jaki ma większość ludzi.
Źródła
3- 01Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
- 02Open weights are not open source: Why AI's favorite label is under disputeEN
- 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.