Otwarte wagi pod lupą: format, który dzieli OpenAI, Google i chińskie laboratoria AI
Otwarte wagi, czyli publikowanie wytrenowanych parametrów modelu tak, by każdy mógł je pobrać i uruchomić, przestały być zajęciem hobbystów i w tym tygodniu znalazły się w centrum branży AI. Najnowszy punkt zapalny pojawił się 30 września, gdy Google zapowiedział wycofanie Gems na rzecz Skills. Firma dołącza tym samym do OpenAI i Anthropic w ruchu, który daje użytkownikom gotowe pliki z poleceniami, a nie maszynerię pod spodem.

To brzmi jak porządki. Nie jest. Skill to plik tekstowy, który zapisujesz i używasz ponownie. Gem był konfiguracją wewnątrz serwerów Google. Ani jedno, ani drugie nie jest modelem, który możesz skopiować na własny laptop i uruchomić, gdy dostawca straci zainteresowanie, zmieni cenę albo zamknie konto. Według The Decoder Gems zniknie w listopadzie dla kont osobistych, w marcu 2027 dla klientów Workspace z sektora przedsiębiorstw i organizacji non-profit, a w czerwcu 2027 dla klientów z edukacji. Istniejące Gems zostaną przekonwertowane automatycznie. W listopadzie kończy się też Opal, eksperyment Google z miniaplikacjami AI z lata 2025.
Ta różnica ma dziś większe znaczenie niż rok temu, bo otwarte wagi przestały być niszą.
We wrześniu Nvidia ogłosiła, że przejmuje Hugging Face, nowojorskie centrum otwartych modeli i zbiorów danych, za 12,9 miliarda dolarów. Rest of World opisał tę transakcję 30 września przy okazji przeglądu chińskich alternatyw dla tej platformy. Portal zaznaczył, że Pekin zablokował Hugging Face w 2023. ModelScope należący do Alibaby, uruchomiony w 2022, hostuje obecnie ponad 170 000 modeli. MoArk od OSChina, wystartował w 2023, obsługuje jakieś 20 000. Xu Yong, dyrektor generalny OSChina, powiedział Rest of World, że „nie każdy może cały czas korzystać z VPN” i że Chiny potrzebują samowystarczalnego ekosystemu AI dla osób mówiących po chińsku.
Tymczasem ten sam tydzień przyniósł serię wydań, które kiedyś wymagałyby korporacyjnego laboratorium i centrum danych. Fermion Research opublikował 30 września Phonon-2, model rozpoznawania mowy angielskiej. Plik waży 164 MB, a model osiąga 5,21 % średniego błędu na poziomie słowa w siedmiu angielskich zestawach Open ASR Leaderboard. Tak podaje sam producent. Wagi udostępniono na licencji CC-BY-4.0, tej samej co Nvidia Parakeet TDT 0.6B v3, z którego się wywodzą. Fermion twierdzi, że każdy otwarty model z lepszym wynikiem w tym rankingu jest co najmniej 5,8 razy większy, a godzina nagrania zamienia się w tekst w około 20 sekund na MacBooku Air.
Nvidia, żeby nie dać się wyprzedzić na własnym podwórku, opublikowała Kumo Tabular na Hugging Face. To otwarty model bazowy do predykcji tabelarycznej, w trzech rozmiarach od 28M do 215M parametrów. Udostępniono go na licencji OpenMDW-1.1 do użytku komercyjnego, a wstępnie wytrenowano wyłącznie na danych sztucznych. Firma twierdzi, że model zajmuje pierwsze miejsce w czterech benchmarkach: TabArena, BeyondArena, TALENT i ScoringBench. Obietnica jest taka, że wytrenowany model potrafi odczytać oznaczoną tabelę jako kontekst i przewidzieć nowe wiersze w jednym przebiegu w przód, bez treningu i bez inżynierii cech.
Co tak naprawdę obiecują nowe wydania
Niektóre z najciekawszych otwartych prac tygodnia nie są wcale wydaniem modelu. Brytyjski AI Security Institute i Meridian Labs opublikowały Inspect, otwartoźródłowe ramy do oceny modeli frontier. W środku są komponowalne zbiory danych, agenci, narzędzia i oceniający, ponad 200 gotowych ewaluacji oraz system sandboxowania, który uruchamia niezaufany kod modelu w Dockerze, Kubernetes, Modal, Proxmox albo Vagrant. Ramy obsługują też zewnętrznych agentów, w tym Claude Code, Codex CLI i Gemini CLI. Jeśli chcesz sprawdzić, czy zapewnienia dostawcy o bezpieczeństwie przetrwają zderzenie z twoim własnym zestawem testowym, to jest właśnie narzędzie, które na to pozwala.
Bespoke Labs opublikowało 30 września Nimble, model 9B oraz przepis na jego trening, oparty na Qwen3.5-9B. Model podejmuje decyzje z typami w jednym kroku, bez rozpisywania rozumowania, więc jest szybki. Repozytorium wyraźnie zaznacza, że zespół nie destylował z Jev od TypeSafe. Chodzi o to, jak mówi README, żeby pokazać, jak przygotować dane, wytrenować i udostępnić taki model. Dziennik zmian zaczyna się 18 września, gdy dodano publiczny zestaw benchmarków, i biegnie przez 22 września, gdy dopasowano temperaturę, aby prawdopodobieństwa modelu lepiej odpowiadały temu, jak często odpowiedzi są poprawne.
Osobny projekt o nazwie Coop idzie dalej. Mieści się pod github.com/commonsense-ai/coop i wstępnie trenuje mały model językowy na oddanym sprzęcie konsumenckim oraz w darmowych planach Hugging Face i GitHub Actions, bez serwera, bez finansowania i bez demona. Pseudogradienty przychodzą jako pull requesty na Hugging Face, a bezstanowe zadanie cron w GitHub Actions je agreguje. Etap 2 jest w toku: około 145M parametrów trenowanych od zera na FineWeb-Edu. Etap 1, model 15M na TinyStories, zakończył się powyżej optymalnego budżetu Chinchilli. Według projektu kilku ochotników na różnych maszynach, Apple Silicon i zwykłych procesorach, wytrenowało ten sam zewnętrzny krok, a wyniki uśredniono w jedną aktualizację.
A PSSA, model językowy niebędący transformerem, napisany od zera w Rust bez PyTorch, TensorFlow czy jakichkolwiek ram ML pod spodem, twierdzi, że przy tych samych parametrach i na tym samym korpusie uczy się szybciej niż transformer i generuje tekst około dwanaście razy szybciej na tym samym procesorze. Autor mówi wprost, dlaczego: aktualizacje wag na token, bank pamięci zapisywany w przebiegu w przód i ścieżka referencyjna na skalarach sprawiły, że framework autogradu był bardziej kłopotliwy niż wart zachodu.
Nie każde otwarte wydanie wygrywa benchmarki. CHOMPI Club udostępniło 30 września swój przenośny sampler, sprzęt i oprogramowanie, jako wydanie po zakończeniu produkcji. W paczce są schematy, BOM, pliki EAGLE PCB i firmware, a także beta syntezator wavetable na 8 głosów o nazwie WAVE. To przypomnienie, że otwarte wagi, otwarty sprzęt i otwarte źródła to trzy różne rzeczy i że firma może robić jedno, nie robiąc pozostałych.
Argument o bezpieczeństwie działa w obie strony
Największa historia tygodnia o otwartych wagach dotyczy jednak modelu, którego wcale nie wydano. The Register poinformował 30 września, że OpenAI oskarżyło osoby powiązane z chińskim Moonshot AI o atak destylacyjny rozpoczęty 1 lipca. Masowe zapytania posłużyły w nim do odtworzenia chronionego rozumowania. Blog OpenAI podał, że 24 i 25 lipca odnotowano skoki liczące 16 000 żądań wykorzystujących odpowiedni wzorzec ekstrakcji od ponad 4 000 użytkowników. Firma zidentyfikowała powiązaną aktywność u ponad 15 000 użytkowników i całkowicie udaremniła kampanię 28 lipca. Nazwała też wrogą destylację ryzykiem dla bezpieczeństwa i bezpieczeństwa narodowego, bo wyodrębnione rozumowanie może posłużyć do wytrenowania innego modelu bez oryginalnych zabezpieczeń.
Samo ujęcie The Register było mniej przychylne. Redakcja zauważyła, że OpenAI trenowało na ogromnych ilościach treści z internetu w trakcie sporów o prawa autorskie, a sprzeciwia się, gdy jej wyniki są wykorzystywane w ten sam sposób. Portal dodał też, że Claude Opus 5.5 od Anthropic, wydany tydzień wcześniej, ma wbudowaną obronę przed destylacją o nazwie preserved thinking.
W jednym akapicie mieści się całe napięcie. Otwarte wagi pozwalają każdemu obejrzeć model, uruchomić go lokalnie i budować na nim bez pozwolenia. Pozwalają też każdemu zdjąć zabezpieczenia i przepakować możliwości. Jedno i drugie jest prawdą, a branża nie ustaliła, które z nich liczy się dla niej bardziej.
Wdrożenie Skills przez Google to cichsza połowa tego samego sporu. Skills to otwarty format, który powstał w Anthropic. Gemini potrafi generować Skille z wcześniejszych rozmów, łączyć kilka w łańcuch i uruchamiać je automatycznie, gdy wykryje pasujące polecenie. Użytkownicy zyskują przenośność instrukcji. Nie zyskują przenośności modelu. OpenAI wygasza swój odpowiednik, Custom GPTs, według The Decoder.
Dla każdego, kto próbuje zdecydować, co uruchomić, praktyczne pytanie nie brzmi: otwarte czy zamknięte. Brzmi: co jeszcze możesz zrobić z tym czymś, gdy firma zmieni zdanie.
Źródła
12- 01Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
- 02The open-source AI platforms vying to become China's Hugging FaceEN
- 03Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 04Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 05Inspect: An open-source framework for large language model evaluationsEN
- 06Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
- 07Coop: A small language model pretrained by volunteersEN
- 08PSSA: A non-transformer language model written from scratch in RustEN
- 09CHOMPI portable sampler instrument is now open-source (hardware and software)EN
- 10Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 11Jevstiller: Open-source tool distills Jev so you can run it locallyEN
- 12Jevstiller: Distill a repeated Jev classification task into a local modelEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.