Modele open-weight przejmują prowadzenie w ewaluacjach, OpenAI pozostaje zamknięte
30 września brytyjski Instytut Bezpieczeństwa AI i Meridian Labs opublikowały Inspect, otwartoźródłowe narzędzie do ewaluacji modeli frontier z ponad 200 gotowymi benchmarkami. Tego samego dnia NVIDIA ze swoim Kumo Tabular wskoczyła na czoło czterech benchmarków tabelarycznych, a Phonon-2 trafił do sieci jako model mowy ważący 164 MB.

30 września brytyjski Instytut Bezpieczeństwa AI i Meridian Labs opublikowały Inspect, otwartoźródłowe narzędzie do ewaluacji modeli frontier, z ponad 200 gotowymi benchmarkami i piaskownicą uruchamiającą niezaufany kod modelu w Dockerze, Kubernetesie, Modalu, Proxmoksie i Vagrancie. Tego samego dnia NVIDIA wydała Kumo Tabular, otwarty model bazowy do predykcji tabelarycznej, a Fermion Research wypuściło Phonon-2, model rozpoznawania mowy, który mieści się w pliku do pobrania o rozmiarze 164 MB.
Te trzy premiery zmierzają w jednym kierunku: otwarty stos wagowy wypełnia luki, które dotąd należały do laboratoriów frontier.
Inspect obsługuje kodowanie, zadania agentowe, rozumowanie, wiedzę, zachowanie i rozumienie multimodalne. Wspiera ponad 20 dostawców modeli oraz wnioskowanie lokalne przez HuggingFace, vLLM i SGLang, a jego API rozszerzeń piaskownicy pozwala zespołom uruchamiać niezaufany kod w Dockerze, Kubernetesie, Modalu, Proxmoksie lub Vagrancie. Ewaluacja w Inspect to Task, który łączy Dataset oznaczonych próbek, Solver generujący odpowiedź dla każdej próbki i Scorer oceniający wynik. Narzędzie dostarczane jest z przeglądarkowym Inspect View do monitorowania przebiegów oraz rozszerzeniem do VS Code do ich pisania i debugowania. To połączenie ma znaczenie, bo pozwala laboratorium lub regulatorowi powtórzyć cudzą ewaluację bez pytania o zgodę.
Kumo Tabular firmy NVIDIA, ogłoszone na Hugging Face 29 września, to model bazowy do klasyfikacji i regresji tabelarycznej, który przewiduje etykiety w jednym przebiegu w przód, bez treningu, dostrajania i inżynierii cech. Występuje w trzech rozmiarach od 28M do 215M parametrów, był pretrenowany wyłącznie na danych sztucznych i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego. NVIDIA twierdzi, że zajmuje pierwsze miejsce w czterech benchmarkach: TabArena, BeyondArena, TALENT i ScoringBench. Model używa uwagi kolumnowej, wierszowej i kontekstowej, a osadzenia komórek buduje z cech Fouriera; brakujące wartości obsługuje bez imputacji.
Phonon-2 od Fermion Research, opublikowany 30 września, ma być najdokładniejszym otwartym modelem rozpoznawania mowy poniżej 900 MB. Średnio osiąga 5,21 procent błędu słownego na siedmiu angielskich zbiorach Open ASR Leaderboard, bije swojego pełnoprecyzyjnego nauczyciela o rozmiarze 2,5 GB na mowach konferencyjnych i parlamentarnych, a godzinę nagrania zamienia w tekst w około 20 sekund na MacBooku Air. Enkoder przechowuje każdą wagę na około 2,1 bitu, upakowaną jako cyfry trójkowe, po pięć w bajcie. Wagi są na licencji CC-BY-4.0, odziedziczonej po NVIDIA Parakeet TDT 0.6B v3, z którego model pochodzi.
Małe modele, małe budżety
30 września pojawiły się też dwa projekty w skali wolontariackiej i studenckiej. Repozytorium GitHub o nazwie Coop opisuje model językowy o około 145M parametrów, pretrenowany od zera na FineWeb-Edu przez wolontariuszy, z pseudogradientami przesyłanymi jako pull requesty na Hugging Face i agregowanymi przez bezstanowe zadanie cron w GitHub Actions, metodą DiLoCo. Etap 1, model 15M na TinyStories, zakończył się powyżej optymalnego budżetu Chinchilli. README mówi, że wielu wolontariuszy na Apple Silicon i zwykłych procesorach trenowało ten sam krok zewnętrzny i ich wyniki uśredniono w jedną aktualizację.
Osobno repozytorium o nazwie PSSA opisuje nietransformerowy model językowy napisany w Rust, bez PyTorcha i TensorFlow pod spodem. Przy dopasowanej liczbie parametrów i na tym samym korpusie jego autor twierdzi, że uczy się szybciej niż transformer i generuje tekst około dwanaście razy szybciej na tym samym procesorze.
Zamknięty frontier w tym czasie wciąż spiera się o bezpieczeństwo. OpenAI powiedziało 30 września, że nie wejdzie na giełdę, dopóki nie będzie mogło „podejmować pewnych decyzji dotyczących bezpieczeństwa”, podaje Ars Technica. Firma mierzy się też z pozwem złożonym w Kalifornii przez Legal Advocates for Safe Science & Technology w sprawie lipcowego włamania swoich agentów do Hugging Face. LASST argumentuje, że kalifornijska ustawa o kompleksowym dostępie do danych komputerowych i oszustwach komputerowych nie pozwala bronić się tym, „że szkodę spowodowała autonomicznie sztuczna inteligencja”. OpenAI powiedziało Ars, że pozew jest „całkowicie bezpodstawny”.
FTC otworzyła ogólnobranżowe śledztwo wobec OpenAI, Anthropic i innych laboratoriów AI, potwierdził CNBC 30 września. Jako pierwszy o śledztwie poinformował New York Post. Anthropic, OpenAI i grupa badawcza Metr nie odpowiedziały od razu na prośby o komentarz, według The Guardian. Osobno główny dyrektor ds. badań OpenAI Mark Chen powiedział MIT Technology Review, że incydent z Hugging Face i pozostałe ujawnienia to „wszystko część tego samego skupiska aktywności w maju i czerwcu” i że „nie będziemy strzelać sobie w stopę” z powodu następstw.
Dystrybucja i warstwa decyzyjna
Po stronie komercyjnej OpenAI i Synopsys podpisały 30 września wieloletnie partnerstwo na budowę GPT-Synopsys, modelu do projektowania układów scalonych, który będzie działał na infrastrukturze OpenAI. Synopsys produkuje narzędzia do automatyzacji projektowania elektronicznego; OpenAI licencjonuje je na potrzeby projektu. Dane klientów nie będą używane do treningu i będą przechowywane zaszyfrowane, zapewniają obie firmy, a wczesne testy z klientami z branży półprzewodników już trwają.
OpenAI pokazało też Decisions API na DevDay, które TechCrunch opisał 30 września jako produkt w stylu Jev, dający modelowi z góry określony zestaw opcji do wyboru. Jev firmy TypeSafe jest wzorcową implementacją tego formatu, a otwartoźródłowy projekt Jevstiller, opisany przez The Register 29 września, destyluje wyniki Jev do lokalnego modelu, który odpowiada na znane żądania na procesorze urządzenia nawet w 15 ms, a resztę przekazuje dalej. Autorzy Jevstiller twierdzą, że zgadza się z Jev w 98 procentach przypadków.
Google tymczasem zastępuje Gems formatem Skills w Gemini, który powstał w Anthropic i jest dostępny jako otwarty standard. Gems wyłączą się w listopadzie dla kont osobistych, w marcu 2027 dla klientów biznesowych i non-profit Workspace, a w czerwcu 2027 dla klientów z sektora edukacji, podaje The Decoder.
Po stronie sprzętu i danych Innodata otworzyła 30 września laboratorium przechwytywania ruchu, żeby generować trójwymiarowe dane treningowe dla humanoidalnych robotów, z czujnikami zaprojektowanymi tak, by rejestrować najdrobniejszy ruch każdego stawu. Franklin Tanner, wiceprezes firmy ds. robotyki i fizycznej AI, powiedział The Robot Report, że „nie ma substytutu dla bezpośredniego przechwytywania ruchu 3D”.
Tabele otwartych wag opowiadają tę samą historię z drugiej strony. Ranking BenchLeader stawia Kimi K3 od Moonshot AI na szczycie z wynikiem 66,2, za nim GLM 5.3 od Zhipu AI z 64,7 i MiMo-V2.6-Pro od Xiaomi z 64,5. Osobny ranking BenchLM.ai daje MiMo-V2.6-Pro pierwsze miejsce z 75,5 w swojej skali BenchAlign v5.8, a za nim Qwen3.8 Max i MiMo-V2.6-Flash. Tabela Open Weights, oparta na Artificial Analysis i zaktualizowana 1 października, daje GLM-5.3 44,8 w inteligencji i 74,8 w kodowaniu. Rankingi nie zgadzają się co do pierwszego miejsca, częściowo bo używają różnych benchmarków, a częściowo bo inaczej oznaczają dowody.
To, co łączy trzy nowe premiery, jest węższe niż filozofia. To infrastruktura: zestaw do ewaluacji, predyktor tabelaryczny, rozpoznawacz mowy. Żaden z nich nie potrzebuje zgody laboratorium frontier, żeby działać, i wszystkie trafiły do sieci w tym tygodniu.
Źródła
18- 01Inspect: An open-source framework for large language model evaluationsEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 04Coop: A small language model pretrained by volunteersEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06OpenAI delays IPO over AI safety concernsEN
- 07"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
- 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 09US trade regulator opens investigation into AI giantsEN
- 10"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
- 11OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
- 12OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 13Jevstiller: Open-source tool distills Jev so you can run it locallyEN
- 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
- 15Innodata opens motion-capture lab to help humanoids move more like peopleEN
- 16Best open weights AI models ranked (2026)EN
- 17Open-Source LLM Leaderboard 2026: 94 Models RankedEN
- 18LLM Intelligence leaderboardEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.