Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Otwarte wagi zmniejszają dystans: nowe rankingi, nowy sprzęt i umowa o chipy

1 października indeks Artificial Analysis Intelligence Index, przedrukowany przez The Open Weights, umieścił GLM-5.3 od Zhipu AI na szczycie dwudziestu modeli z otwartymi wagami z wynikiem 44,8, przed Kimi K3 od Moonshot AI z 43,6. Kolejne premiery wciąż napływają.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 30 września 20264 min czytaniaŹródła 14
Otwarte wagi zmniejszają dystans: nowe rankingi, nowy sprzęt i umowa o chipy

1 października indeks Artificial Analysis Intelligence Index, przedrukowany przez The Open Weights, umieścił GLM-5.3 od Zhipu AI na szczycie dwudziestu modeli z otwartymi wagami z wynikiem 44,8, przed Kimi K3 od Moonshot AI z 43,6. Kolejne premiery wciąż napływają.

Rankingi nie zgadzają się ze sobą i trzeba to powiedzieć wprost. Tablica otwartych wag BenchLeader, zaktualizowana 12 godzin przed publikacją, stawia Kimi K3 od Moonshot AI na pierwszym miejscu z 66,2. Drugi jest Zhipu GLM 5.3 max z 64,7, trzeci MiMo-V2.6-Pro od Xiaomi z 64,5. Tablica 94 modeli w BenchLM.ai wymienia z kolei MiMo-V2.6-Pro jako pierwszy z wynikiem BenchAlign v5.8 równym 75,5, za nim Qwen3.8 Max i MiMo-V2.6-Flash. LMMarketCap opublikował aktualizację 1 października o 06:00 i stawia Qwen3.8 27B od Alibaba na pierwszym miejscu wśród 175 otwartych modeli. Gemma 4 26B A4B i Gemma 4 31B od Google dzielą drugie miejsce.

Różne panele, różni zwycięzcy. Wszystkie cztery tablice łączy to, że górne wiersze zajmują chińskie laboratoria i Google, a Nvidia, Meta i Mistral są niżej.

Ostatnie 72 godziny przyniosły też kilka nowych otwartych modeli, których nie ma jeszcze na tych tablicach. Nvidia opublikowała 29 września Kumo Tabular, model bazowy do klasyfikacji i regresji na danych tabelarycznych. Dostępny jest w trzech rozmiarach od 28M do 215M parametrów, trenowano go wyłącznie na danych sztucznych, a wydano na licencji OpenMDW-1.1 do użytku komercyjnego. Firma twierdzi, że model zajmuje pierwsze miejsce na TabArena, BeyondArena, TALENT i ScoringBench i nie wymaga treningu ani inżynierii cech przy każdym zadaniu.

Fermion Research wydała 30 września Phonon-2, model rozpoznawania mowy angielskiej w pliku do pobrania o rozmiarze 164 MB. Jego koder przechowuje każdą wagę na około 2,1 bita. Firma podaje, że model osiąga średnio 5,21 procent błędu na siedmiu angielskich zbiorach Open ASR Leaderboard i że każdy otwarty model z lepszym wynikiem jest co najmniej 5,8 razy większy. Godzina dźwięku transkrybuje się w około 20 sekund na MacBooku Air. Wagi są na licencji CC-BY-4.0, wyprowadzone z Parakeet TDT 0.6B v3 od Nvidii. Bespoke Labs opublikowała 30 września Nimble, model 9B zbudowany na Qwen3.5-9B, który zwraca typowane decyzje z prawdopodobieństwami zamiast dowolnego tekstu. W README napisano, że przykłady treningowe i walidacyjne opublikowano 20 września, po tym jak pominięto je w pierwszym wydaniu.

Dwa otwarte projekty sprawdzają, czy sam cykl treningowy da się rozproszyć. Repozytorium coop projektu Commonsense AI, zaktualizowane 30 września, opisuje wstępny trening modelu o około 145M parametrów od zera na FineWeb-Edu. Wolontariusze wykonują lokalne kroki AdamW na użyczonym sprzęcie i przesyłają pseudogradienty jako pull requesty na Hugging Face, a bezstanowe zadanie cron w GitHub Actions co pięć minut agreguje je średnią uciętą lub medianą geometryczną. Etap 1, model 15M na TinyStories, zakończył się powyżej optymalnego budżetu Chinchilli. Osobno PSSA, nietransformerowy model językowy napisany w Rust bez żadnego frameworka ML pod spodem, twierdzi, że uczy się szybciej niż transformer przy tych samych parametrach i generuje około dwanaście razy szybciej na tym samym procesorze.

Strona komercyjna też się ruszyła. OpenAI i Synopsys podały 30 września, że podpisały wieloletnie partnerstwo na budowę GPT-Synopsys, modelu do projektowania i weryfikacji chipów. Model obsługiwałby narzędzia EDA Synopsys bezpośrednio i działał na infrastrukturze OpenAI. Dane klientów nie są używane do treningu, a przychody dzielone między obie firmy. The Register podał 30 września, że OpenAI oskarżyła osoby związane z Moonshot AI o kampanię destylacji rozpoczętą 1 lipca. Szczyty przypadły na 24 i 25 lipca: 16 000 żądań od ponad 4 000 użytkowników i powiązana aktywność na ponad 15 000 kont. Akcję przerwano 28 lipca. Moonshot nie odpowiedział na prośbę The Register o komentarz.

Regulatorzy krążą wokół tych samych laboratoriów. FTC wszczęła branżowe śledztwo wobec OpenAI, Anthropic i innych, co potwierdził CNBC 30 września. The Guardian podał tego samego dnia, że agencja planuje formalne żądania informacji i zeznań, w tym od grupy badawczej Metr. Ani OpenAI, ani Anthropic nie skomentowały sprawy dla CNBC. New York Post jako pierwszy poinformował o śledztwie. 29 września organizacja non-profit Legal Advocates for Safe Science & Technology pozwała OpenAI w sądzie hrabstwa San Francisco w sprawie włamania do Hugging Face w lipcu. Domaga się nakazu, a nie odszkodowania, według Ars Technica, która zacytowała OpenAI nazywającą pozew "całkowicie bezpodstawnym".

Dla każdego, kto dziś wybiera otwarty model, praktyczna lekcja z tego tygodnia jest taka, że żaden pojedynczy ranking nie rozstrzyga sprawy. Tablice szeregują różne zestawy modeli, a model mowy o rozmiarze 164 MB czy model tabelaryczny 215M może mieć większe znaczenie dla wdrożenia niż to, kto siedzi na pierwszym miejscu.

Komentarze 0

Źródła

14
  1. 01LLM Intelligence leaderboard - The Open WeightsEN
  2. 02Best open weights AI models ranked (2026) - BenchLeaderEN
  3. 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
  4. 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
  5. 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  6. 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  7. 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  8. 08Coop: A small language model pretrained by volunteersEN
  9. 09PSSA: A non-transformer language model written from scratch in RustEN
  10. 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  11. 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  12. 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  13. 13US trade regulator opens investigation into AI giantsEN
  14. 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.