Otwarte wagi wciąż spadają: model mowy 164 MB, wolontariacki trening 145 i chińska alternatywa dla CUDA
Nvidia opublikowała Kumo Tabular, otwarty model bazowy do przewidywania na danych tabelarycznych, w poście na Hugging Face z 29 września, a dzień później Fermion Research udostępniła model mowy Phonon-2 o rozmiarze 164 MB. Jedno i drugie pojawia się w momencie, gdy FTC wszczyna branżowe śledztwo wobec laboratoriów AI, a OpenAI wstrzymuje własne IPO.

Nvidia umieściła Kumo Tabular na Hugging Face 29 września. Post z 29 września, opublikowany na blogu 30 września, mówi, że model przewiduje etykiety dla nowych wierszy w jednym przebiegu propagacji w przód, bez treningu, bez dostrajania i bez inżynierii cech. Występuje w trzech rozmiarach od 28M do 215M parametrów, był pretrenowany wyłącznie na danych sztucznych i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego. Firma twierdzi, że zajmuje pierwsze miejsce w TabArena, BeyondArena, TALENT i ScoringBench.
To wąskie twierdzenie i Nvidia sama je zawęża: klasyfikacja i regresja tabelaryczna, czyli tabele z danymi klientów, transakcjami i zapisami z czujników. Chodzi o uczenie w kontekście zastosowane do wierszy, nie do tekstu. Model pretrenowany na milionach tabel czyta oznaczoną tabelę jako kontekst i zwraca prawdopodobieństwa klas albo 999 kwantyli dla regresji, z których wynikają przewidywanie punktowe i oszacowanie niepewności.
Fermion Research udostępniła Phonon-2 30 września, nazywając go najdokładniejszym otwartym modelem rozpoznawania mowy poniżej 900 MB.
Do pobrania jest 164 MB, koder zapisuje każdą wagę na około 2.1 bita, a wagi są na licencji CC-BY-4.0, tej samej co Nvidia Parakeet TDT 0.6B v3, od którego się wywodzą. Fermion podaje 5.21 % średniego współczynnika błędów słów w siedmiu angielskich zestawach Open ASR Leaderboard i twierdzi, że każdy otwarty model z lepszym wynikiem jest co najmniej 5.8 razy większy. Na MacBooku Air zamienia godzinę dźwięku w tekst w około 20 sekund. To liczby producenta z jego własnej strony, więc pozycję w rankingu traktuj jako deklarowaną, a nie potwierdzoną niezależnie.
Wolontariusze i bezstanowe zadanie cron
Także 30 września ruszył projekt na GitHubie o nazwie Coop z przebiegiem etapu 2: trening od zera około 145-milionowego transformera z samym dekoderem na FineWeb-Edu, przeprowadzony w całości na oddanym sprzęcie konsumenckim plus darmowych planach Hugging Face i GitHub Actions. Nie ma serwera ani demona. Workery pobierają punkt kontrolny, wykonują lokalne kroki AdamW na osobistym fragmencie danych i zgłaszają pseudo-gradient jako pull request do publicznego repozytorium zbioru danych.
Bezstanowe zadanie cron w GitHub Actions agreguje każdy takt: odrzuca zbyt stare zgłoszenia, przycina i bramkuje kosinusowo pozostałe, agreguje je, wykonuje jeden zewnętrzny krok Nesterowa i wgrywa nowy punkt kontrolny. Repozytorium twierdzi, że 15-milionowy model etapu 1 był pretrenowany ponad optymalny budżet Chinchilli na TinyStories w sześć dni, a strata walidacyjna spadła z 9.01 do 2.8. To dowód mechanizmu, nie konkurencyjny model.
Chiński wysiłek to większa historia strategiczna. Deepseek udostępnił otwartoźródłowe narzędzia programistyczne dla chipów Ascend Huawei, według postu na swoim kanale WeChat, o którym 30 września doniósł The Decoder i Reuters. Głównym elementem jest TileLang, otwartoźródłowy język pierwotnie rozwijany na Uniwersytecie Pekińskim, który według Deepseek oferuje prostszy model programowania niż CUDA. Huawei "w pełni wsparł" tę pracę, powiedział Deepseek, a obie firmy zoptymalizowały superwęzeł 128 chipów Ascend 950.
Kontekstem jest fosa deweloperska Nvidii: szacunkowo cztery miliony programistów CUDA. The Decoder cytuje też SemiAnalysis, które przetestowało chip wnioskowania OpenAI o nazwie Jalapeno i nazwało fosę CUDA "potencjalnie martwą", ostrzegając zarazem, że testowało tylko stosunkowo łatwe scenariusze około 8 000 tokenów wejściowych i 1 000 tokenów wyjściowych. Chipy Huawei nie były częścią tego porównania.
Regulatorzy działają, gdy wagi płyną
Nic z tego nie dzieje się w próżni. The Guardian doniósł 30 września, że FTC prowadzi branżowe śledztwo wobec Anthropic, OpenAI i innych laboratoriów, z planami wymuszenia zeznań od kadry kierowniczej, w tym w Metr. Jako pierwszy podał to New York Post. OpenAI tymczasem wstrzymuje własne wejście na giełdę: Ars Technica doniósł 30 września, że Sam Altman nie upubliczni firmy, dopóki nie będzie mogła "podejmować pewnych decyzji o bezpieczeństwie", a tego samego dnia LASST złożył pozew w Kalifornii.
Powyższe wydania otwartych wag są małe, tanie i konkretne. To wzorzec, któremu warto się przyglądać, nie tabele z rankingów.
Źródła
6- 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Coop: A small language model pretrained by volunteersEN
- 04China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 05US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 06OpenAI delays IPO over AI safety concernsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.