Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Otwarte wagi wciąż spadają: model mowy 164 MB, wolontariacki trening 145 i chińska alternatywa dla CUDA

Nvidia opublikowała Kumo Tabular, otwarty model bazowy do przewidywania na danych tabelarycznych, w poście na Hugging Face z 29 września, a dzień później Fermion Research udostępniła model mowy Phonon-2 o rozmiarze 164 MB. Jedno i drugie pojawia się w momencie, gdy FTC wszczyna branżowe śledztwo wobec laboratoriów AI, a OpenAI wstrzymuje własne IPO.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 30 września 20263 min czytaniaŹródła 6
Otwarte wagi wciąż spadają: model mowy 164 MB, wolontariacki trening 145 i chińska alternatywa dla CUDA

Nvidia umieściła Kumo Tabular na Hugging Face 29 września. Post z 29 września, opublikowany na blogu 30 września, mówi, że model przewiduje etykiety dla nowych wierszy w jednym przebiegu propagacji w przód, bez treningu, bez dostrajania i bez inżynierii cech. Występuje w trzech rozmiarach od 28M do 215M parametrów, był pretrenowany wyłącznie na danych sztucznych i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego. Firma twierdzi, że zajmuje pierwsze miejsce w TabArena, BeyondArena, TALENT i ScoringBench.

To wąskie twierdzenie i Nvidia sama je zawęża: klasyfikacja i regresja tabelaryczna, czyli tabele z danymi klientów, transakcjami i zapisami z czujników. Chodzi o uczenie w kontekście zastosowane do wierszy, nie do tekstu. Model pretrenowany na milionach tabel czyta oznaczoną tabelę jako kontekst i zwraca prawdopodobieństwa klas albo 999 kwantyli dla regresji, z których wynikają przewidywanie punktowe i oszacowanie niepewności.

Fermion Research udostępniła Phonon-2 30 września, nazywając go najdokładniejszym otwartym modelem rozpoznawania mowy poniżej 900 MB.

Do pobrania jest 164 MB, koder zapisuje każdą wagę na około 2.1 bita, a wagi są na licencji CC-BY-4.0, tej samej co Nvidia Parakeet TDT 0.6B v3, od którego się wywodzą. Fermion podaje 5.21 % średniego współczynnika błędów słów w siedmiu angielskich zestawach Open ASR Leaderboard i twierdzi, że każdy otwarty model z lepszym wynikiem jest co najmniej 5.8 razy większy. Na MacBooku Air zamienia godzinę dźwięku w tekst w około 20 sekund. To liczby producenta z jego własnej strony, więc pozycję w rankingu traktuj jako deklarowaną, a nie potwierdzoną niezależnie.

Wolontariusze i bezstanowe zadanie cron

Także 30 września ruszył projekt na GitHubie o nazwie Coop z przebiegiem etapu 2: trening od zera około 145-milionowego transformera z samym dekoderem na FineWeb-Edu, przeprowadzony w całości na oddanym sprzęcie konsumenckim plus darmowych planach Hugging Face i GitHub Actions. Nie ma serwera ani demona. Workery pobierają punkt kontrolny, wykonują lokalne kroki AdamW na osobistym fragmencie danych i zgłaszają pseudo-gradient jako pull request do publicznego repozytorium zbioru danych.

Bezstanowe zadanie cron w GitHub Actions agreguje każdy takt: odrzuca zbyt stare zgłoszenia, przycina i bramkuje kosinusowo pozostałe, agreguje je, wykonuje jeden zewnętrzny krok Nesterowa i wgrywa nowy punkt kontrolny. Repozytorium twierdzi, że 15-milionowy model etapu 1 był pretrenowany ponad optymalny budżet Chinchilli na TinyStories w sześć dni, a strata walidacyjna spadła z 9.01 do 2.8. To dowód mechanizmu, nie konkurencyjny model.

Chiński wysiłek to większa historia strategiczna. Deepseek udostępnił otwartoźródłowe narzędzia programistyczne dla chipów Ascend Huawei, według postu na swoim kanale WeChat, o którym 30 września doniósł The Decoder i Reuters. Głównym elementem jest TileLang, otwartoźródłowy język pierwotnie rozwijany na Uniwersytecie Pekińskim, który według Deepseek oferuje prostszy model programowania niż CUDA. Huawei "w pełni wsparł" tę pracę, powiedział Deepseek, a obie firmy zoptymalizowały superwęzeł 128 chipów Ascend 950.

Kontekstem jest fosa deweloperska Nvidii: szacunkowo cztery miliony programistów CUDA. The Decoder cytuje też SemiAnalysis, które przetestowało chip wnioskowania OpenAI o nazwie Jalapeno i nazwało fosę CUDA "potencjalnie martwą", ostrzegając zarazem, że testowało tylko stosunkowo łatwe scenariusze około 8 000 tokenów wejściowych i 1 000 tokenów wyjściowych. Chipy Huawei nie były częścią tego porównania.

Regulatorzy działają, gdy wagi płyną

Nic z tego nie dzieje się w próżni. The Guardian doniósł 30 września, że FTC prowadzi branżowe śledztwo wobec Anthropic, OpenAI i innych laboratoriów, z planami wymuszenia zeznań od kadry kierowniczej, w tym w Metr. Jako pierwszy podał to New York Post. OpenAI tymczasem wstrzymuje własne wejście na giełdę: Ars Technica doniósł 30 września, że Sam Altman nie upubliczni firmy, dopóki nie będzie mogła "podejmować pewnych decyzji o bezpieczeństwie", a tego samego dnia LASST złożył pozew w Kalifornii.

Powyższe wydania otwartych wag są małe, tanie i konkretne. To wzorzec, któremu warto się przyglądać, nie tabele z rankingów.

Komentarze 0

Źródła

6
  1. 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03Coop: A small language model pretrained by volunteersEN
  4. 04China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
  5. 05US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  6. 06OpenAI delays IPO over AI safety concernsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.