Phonon-2, Coop i Kumo Tabular: tydzień małych modeli w otwartym AI
Fermion Research udostępnił 30 września Phonon-2, otwarty model rozpoznawania mowy angielskiej. Mieści się w pliku o rozmiarze 164 MB i osiąga średnio 5,21 procent błędu na siedmiu angielskich zestawach Open ASR Leaderboard. Premiera zbiegła się z tygodniem, w którym o zmianach mówiły głównie otwarte wagi, a nie premiery modeli z czołówki.

W tym modelu chodzi o rozmiar. Fermion Research twierdzi, że enkoder zapisuje każdą wagę jako jeden z pięciu wyuczonych poziomów przy około 2,1 bita. Wagi są udostępnione na licencji CC-BY-4.0, a ten sam plik działa na Macach, Linuksie, Windowsie i kartach NVIDIA. Firma podaje, że na MacBooku Air godzina nagrania zamienia się w tekst w około 20 sekund.
Dwa kolejne otwarte wydania pojawiły się tego samego dnia. NVIDIA opublikowała na Hugging Face Kumo Tabular, otwarty model bazowy do przewidywania na danych tabelarycznych. Wolontariacki projekt Coop opublikował repozytorium opisujące mały model językowy wstępnie trenowany bez serwera, bez finansowania i bez demona.
Co mówią liczby
Głównym argumentem Phonon-2 jest dokładność na bajt. Fermion twierdzi, że na siedmiu angielskich zestawach Open ASR Leaderboard model osiąga średnio 5,21 procent błędu na słowo, a każdy otwarty model z lepszym wynikiem jest co najmniej 5,8 razy większy. Na mowie parlamentarnej model osiąga 100,8 procent dokładności słownej swojego nauczyciela, a na spotkaniach go przewyższa, choć plik jest 15 razy mniejszy, podaje firma. Punktem odniesienia jest Parakeet TDT 0.6B v3 od NVIDII, który Fermion wskazuje jako źródło licencji dla własnych wag. Firma dodaje, że Phonon-2 wyprzedza Parakeet Redux, opisywany jako drugi model niskobitowy w tym rozmiarze, na każdym testowanym poziomie szumu. To dane producenta, opublikowane razem z modelem. Szybkie ścieżki obliczeń wchodzą do użycia tylko wtedy, gdy błąd na słowo mieści się w granicach szumu ścieżki dokładnej, wynika z materiału Fermionu.
Model tabelaryczny NVIDII idzie inną drogą. Kumo Tabular przewiduje etykiety dla nowych wierszy w jednym przejściu w przód, bez trenowania, dostrajania i inżynierii cech, w zadaniach klasyfikacji i regresji. Był wstępnie trenowany wyłącznie na danych sztucznych, występuje w trzech rozmiarach od 28M do 215M parametrów i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego, podaje firma. NVIDIA ogłasza pierwsze miejsce na czterech rankingach: TabArena, BeyondArena, TALENT i ScoringBench.
Pętla treningowa bez właściciela
Coop jest najdziwniejszy z tej trójki. Jego strona na GitHubie opisuje pseudogradienty przychodzące jako pull requesty na Hugging Face, agregowane przez bezstanowe zadanie cron w GitHub Actions z użyciem DiLoCo. Wagi i stan optymalizatora istnieją tylko na Hugging Face. Pracę wykonują przekazany sprzęt konsumencki i darmowe plany. Etap 2 to model o około 145M parametrów trenowany od zera na FineWeb-Edu; etap 1, model 15M na TinyStories, zakończył się po przekroczeniu optymalnego budżetu Chinchilli, podaje repozytorium.
Projekt twierdzi, że kilku wolontariuszy na różnych maszynach, Apple Silicon i zwykłych procesorach, wytrenowało ten sam zewnętrzny krok i zostało uśrednionych w jednej aktualizacji. Opisuje też obsługę błędów: zgłoszenie, które ścigało się z taktem, przyjęto o jeden krok później z obniżoną wagą nieaktualności, powtórzone rundy od jednego użytkownika scalono w jeden głos, a niedokończoną rundę opróżniono zamiast odrzucić. To nie jest praca z czołówki. I o to chodzi. Tego samego dnia brytyjski AI Security Institute i Meridian Labs opublikowały Inspect, otwarty framework do ewaluacji modeli czołówki z ponad 200 gotowymi testami, wsparciem dla ponad 20 dostawców modeli oraz sandboxingiem w Dockerze, Kubernetesie i Modalu.
Gdzie indziej spór otwarte kontra zamknięte toczy się publicznie. The Register podał 30 września, że OpenAI oskarżyła osoby związane z chińskim Moonshot AI o atak destylacyjny, który zaczął się 1 lipca, ze skokami ruchu 24 i 25 lipca, gdy 4 000 użytkowników wysłało 16 000 zapytań. OpenAI poinformowała, że przerwała kampanię 28 lipca. Moonshot nie odpowiedział od razu na prośbę The Register o komentarz. Tego samego dnia The Decoder podał, że DeepSeek udostępnił otwarte narzędzia programistyczne dla układów Ascend firmy Huawei, oparte na TileLang, otwartym języku stworzonym pierwotnie przez badaczy z Uniwersytetu Pekińskiego. Reuters, cytowany w tym materiale, wymienił obok tego biblioteki do obliczeń i przesyłania danych między układami. DeepSeek podał, że Huawei w pełni wsparł prace, a obie firmy zoptymalizowały superwęzeł 128 układów Ascend 950. Regulatorzy działają w tym samym czasie. The Guardian podał 30 września, że FTC wszczęła branżowe śledztwo wobec Anthropic i OpenAI, z formalnymi żądaniami informacji i zeznań. To pierwsza oficjalna akcja egzekucyjna w USA dotycząca samodzielnie działających agentów AI. CNBC potwierdziło postępowanie i podało, że FTC nie chce wymienić innych badanych firm.
Otwarte wydania opisane wyżej nie mają związku z tą sprawą. Łączy je jednak założenie: że zdolności, a przynajmniej te użyteczne, przesuwają się w stronę wag, które każdy może pobrać. Tegoroczny dowód to małe modele do wąskich zadań, wolontariacka pętla treningowa i tabela wyników od producenta. Czy złoży się z tego zmiana, odpowiedzą najbliższe cykle wydawnicze.
Źródła
14- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giantsEN
- 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 09OpenAI delays IPO over AI safety concernsEN
- 10OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
- 11"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
- 12"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
- 13OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.