Otwarte wagi zmniejszają dystans: nowe rankingi, nowy sprzęt i umowa o chipy
1 października indeks Artificial Analysis Intelligence Index, przedrukowany przez The Open Weights, umieścił GLM-5.3 od Zhipu AI na szczycie dwudziestu modeli z otwartymi wagami z wynikiem 44,8, przed Kimi K3 od Moonshot AI z 43,6. Kolejne premiery wciąż napływają.

1 października indeks Artificial Analysis Intelligence Index, przedrukowany przez The Open Weights, umieścił GLM-5.3 od Zhipu AI na szczycie dwudziestu modeli z otwartymi wagami z wynikiem 44,8, przed Kimi K3 od Moonshot AI z 43,6. Kolejne premiery wciąż napływają.
Rankingi nie zgadzają się ze sobą i trzeba to powiedzieć wprost. Tablica otwartych wag BenchLeader, zaktualizowana 12 godzin przed publikacją, stawia Kimi K3 od Moonshot AI na pierwszym miejscu z 66,2. Drugi jest Zhipu GLM 5.3 max z 64,7, trzeci MiMo-V2.6-Pro od Xiaomi z 64,5. Tablica 94 modeli w BenchLM.ai wymienia z kolei MiMo-V2.6-Pro jako pierwszy z wynikiem BenchAlign v5.8 równym 75,5, za nim Qwen3.8 Max i MiMo-V2.6-Flash. LMMarketCap opublikował aktualizację 1 października o 06:00 i stawia Qwen3.8 27B od Alibaba na pierwszym miejscu wśród 175 otwartych modeli. Gemma 4 26B A4B i Gemma 4 31B od Google dzielą drugie miejsce.
Różne panele, różni zwycięzcy. Wszystkie cztery tablice łączy to, że górne wiersze zajmują chińskie laboratoria i Google, a Nvidia, Meta i Mistral są niżej.
Ostatnie 72 godziny przyniosły też kilka nowych otwartych modeli, których nie ma jeszcze na tych tablicach. Nvidia opublikowała 29 września Kumo Tabular, model bazowy do klasyfikacji i regresji na danych tabelarycznych. Dostępny jest w trzech rozmiarach od 28M do 215M parametrów, trenowano go wyłącznie na danych sztucznych, a wydano na licencji OpenMDW-1.1 do użytku komercyjnego. Firma twierdzi, że model zajmuje pierwsze miejsce na TabArena, BeyondArena, TALENT i ScoringBench i nie wymaga treningu ani inżynierii cech przy każdym zadaniu.
Fermion Research wydała 30 września Phonon-2, model rozpoznawania mowy angielskiej w pliku do pobrania o rozmiarze 164 MB. Jego koder przechowuje każdą wagę na około 2,1 bita. Firma podaje, że model osiąga średnio 5,21 procent błędu na siedmiu angielskich zbiorach Open ASR Leaderboard i że każdy otwarty model z lepszym wynikiem jest co najmniej 5,8 razy większy. Godzina dźwięku transkrybuje się w około 20 sekund na MacBooku Air. Wagi są na licencji CC-BY-4.0, wyprowadzone z Parakeet TDT 0.6B v3 od Nvidii. Bespoke Labs opublikowała 30 września Nimble, model 9B zbudowany na Qwen3.5-9B, który zwraca typowane decyzje z prawdopodobieństwami zamiast dowolnego tekstu. W README napisano, że przykłady treningowe i walidacyjne opublikowano 20 września, po tym jak pominięto je w pierwszym wydaniu.
Dwa otwarte projekty sprawdzają, czy sam cykl treningowy da się rozproszyć. Repozytorium coop projektu Commonsense AI, zaktualizowane 30 września, opisuje wstępny trening modelu o około 145M parametrów od zera na FineWeb-Edu. Wolontariusze wykonują lokalne kroki AdamW na użyczonym sprzęcie i przesyłają pseudogradienty jako pull requesty na Hugging Face, a bezstanowe zadanie cron w GitHub Actions co pięć minut agreguje je średnią uciętą lub medianą geometryczną. Etap 1, model 15M na TinyStories, zakończył się powyżej optymalnego budżetu Chinchilli. Osobno PSSA, nietransformerowy model językowy napisany w Rust bez żadnego frameworka ML pod spodem, twierdzi, że uczy się szybciej niż transformer przy tych samych parametrach i generuje około dwanaście razy szybciej na tym samym procesorze.
Strona komercyjna też się ruszyła. OpenAI i Synopsys podały 30 września, że podpisały wieloletnie partnerstwo na budowę GPT-Synopsys, modelu do projektowania i weryfikacji chipów. Model obsługiwałby narzędzia EDA Synopsys bezpośrednio i działał na infrastrukturze OpenAI. Dane klientów nie są używane do treningu, a przychody dzielone między obie firmy. The Register podał 30 września, że OpenAI oskarżyła osoby związane z Moonshot AI o kampanię destylacji rozpoczętą 1 lipca. Szczyty przypadły na 24 i 25 lipca: 16 000 żądań od ponad 4 000 użytkowników i powiązana aktywność na ponad 15 000 kont. Akcję przerwano 28 lipca. Moonshot nie odpowiedział na prośbę The Register o komentarz.
Regulatorzy krążą wokół tych samych laboratoriów. FTC wszczęła branżowe śledztwo wobec OpenAI, Anthropic i innych, co potwierdził CNBC 30 września. The Guardian podał tego samego dnia, że agencja planuje formalne żądania informacji i zeznań, w tym od grupy badawczej Metr. Ani OpenAI, ani Anthropic nie skomentowały sprawy dla CNBC. New York Post jako pierwszy poinformował o śledztwie. 29 września organizacja non-profit Legal Advocates for Safe Science & Technology pozwała OpenAI w sądzie hrabstwa San Francisco w sprawie włamania do Hugging Face w lipcu. Domaga się nakazu, a nie odszkodowania, według Ars Technica, która zacytowała OpenAI nazywającą pozew "całkowicie bezpodstawnym".
Dla każdego, kto dziś wybiera otwarty model, praktyczna lekcja z tego tygodnia jest taka, że żaden pojedynczy ranking nie rozstrzyga sprawy. Tablice szeregują różne zestawy modeli, a model mowy o rozmiarze 164 MB czy model tabelaryczny 215M może mieć większe znaczenie dla wdrożenia niż to, kto siedzi na pierwszym miejscu.
Źródła
14- 01LLM Intelligence leaderboard - The Open WeightsEN
- 02Best open weights AI models ranked (2026) - BenchLeaderEN
- 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
- 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
- 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
- 08Coop: A small language model pretrained by volunteersEN
- 09PSSA: A non-transformer language model written from scratch in RustEN
- 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
- 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 13US trade regulator opens investigation into AI giantsEN
- 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.