Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Premiery modeli AI przyspieszają, ale benchmarki nie nadążają

Połowa z 20 modeli śledzonych przez stale.jock.pl trafia na rynek bez podanej daty odcięcia danych treningowych. W tygodniu 14 września modele chińskie odpowiadały za 57% do 67% tokenów na OpenRouterze.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 28 września 20267 min czytaniaŹródła 3
Premiery modeli AI przyspieszają, ale benchmarki nie nadążają

Między 1 a 22 września 2026 roku miało miejsce sześć premier modeli, wynika z trackera stale.jock.pl. Serwis podaje daty wydania i daty odcięcia danych treningowych dla 20 aktualnych modeli z ośmiu laboratoriów. Same OpenAI wypuściło trzy 22 września: GPT-6 Sol, GPT-6 Luna i Claude Opus 5.5 od Anthropic tego samego dnia, zgodnie z tabelą trackera i ostatnimi nagłówkami. Kalendarz premier modeli frontier mierzy się dziś w dniach, nie w kwartałach.

Narzędzie, którym te modele się ocenia, nie dotrzymuje jednak kroku. Daty odcięcia danych treningowych, czyli momentu, w którym model przestał czytać, podano tylko dla połowy modeli z listy. Pięć z ośmiu laboratoriów, Anthropic, Google DeepMind, Meta, OpenAI i xAI, podaje datę odcięcia dla co najmniej jednego modelu, twierdzi tracker. Puste pole oznacza, że sprawdzone źródła producenta nie ustaliły daty odcięcia, a nie dowód, że taka data nie istnieje.

Luka między wydaniem a wiedzą

Sam tracker ujmuje to wprost: o tym, jak aktualny jest model, decydują dwie daty. Data wydania to moment, w którym laboratorium wypuściło model. Data odcięcia to moment, w którym przestał czytać. GPT-6 Astra, wydany 3 września 2026 roku, ma datę odcięcia 30 kwietnia 2026 roku, wynika ze strony. W dniu premiery był więc mniej więcej cztery miesiące do tyłu. Claude Fable 5.1, wydany 1 września 2026 roku, ma datę odcięcia czerwiec 2026. Gemini 3.1 Pro, wydany 19 lutego 2026 roku, przestał czytać w styczniu 2025 roku, ponad rok przed premierą.

Model może trafić na rynek we wrześniu i wciąż przestać czytać w kwietniu, co oznacza, że w dniu premiery jest pięć miesięcy do tyłu.

Ta luka ma większe znaczenie, gdy cykle premier się skracają. Mistral AI wypuścił Mistral Large 3 2 grudnia 2025 roku, Mistral Small 4 16 marca 2026 roku i Mistral Medium 3.5 28 kwietnia 2026 roku. Żaden z nich nie ma opublikowanej daty odcięcia, wynika z trackera. Qwen3.8-Max od Alibaby (3 sierpnia 2026), Qwen3.8-Flash (26 sierpnia 2026) oraz V4-Pro od DeepSeek (13 sierpnia 2026) i V4.1-Flash (10 września 2026) też figurują bez opublikowanych dat odcięcia. To samo dotyczy Muse Glimmer i Muse Spark 1.3 od Meta oraz Gemini 3.8 Flash od Google DeepMind.

Narzędzia wyszukiwania nie zamykają tej luki, przekonuje strona. Model, który przeszukuje sieć, czyta kilka stron, wykorzystuje je w jednej odpowiedzi i zapomina. Po otwarciu nowego czatu wraca do swojej daty odcięcia. Co gorsza, wyszukiwanie musi wywołać sam model, tymi samymi wagami, które trzymają nieaktualny fakt. Błędy pojawiają się więc tam, gdzie model jest najbardziej pewny siebie. Strona przywołuje pomiar ponad 2000 wywołań w 16 modelach, z których każdy dostał narzędzie wyszukiwania w sieci. Modele frontier decydowały poprawnie niemal za każdym razem, a słabsze podawały ustalone fakty, które się zmieniły, i szukały w sieci rzeczy takich jak temperatura wrzenia wody.

Użycie zmienia się szybciej niż benchmarki

Gdy laboratoria ścigają się z premierami, dane o użyciu opowiadają inną historię o tym, po które modele deweloperzy faktycznie sięgają. Chińskie modele AI przeszły od niewielkiego udziału w użyciu do większości na dwóch dużych platformach deweloperskich w 2026 roku, podaje CNBC, powołując się na dane o użyciu udostępnione stacji. Na OpenRouterze modele chińskie odpowiadały za 57% do 67% wykorzystanych tokenów w tygodniu 14 września, w górę z 6% do 13% w lutym. Na Vercelu ich udział wzrósł do 55% w sierpniu z 11% w styczniu.

Adopcja koncentruje się w tym, co OpenRouter określa jako Globalne Południe, 82 kraje w Ameryce Środkowej i Południowej, Afryce i Azji. Ponad dwie trzecie tokenów wykorzystywanych przez te firmy trafia do modeli chińskich, relacjonowało CNBC. Około połowy tokenów na OpenRouterze zużywają firmy ze Stanów Zjednoczonych.

Rozmówcy CNBC wskazują na cenę jako siłę napędową. Peter Walker, szef działu analiz w OpenRouterze, powiedział stacji, że chińskie modele open source wydane w tym roku "potrafią wiarygodnie działać w zaawansowanych zastosowaniach agentowych, zwłaszcza w kodowaniu, w sposób, który pod koniec 2025 roku po prostu nie był prawdą". Są też "niesamowicie opłacalne w porównaniu z większością modeli z amerykańskich laboratoriów", dodał. Harpreet Arora, szef infrastruktury agentowej w Vercelu, powiedział CNBC, że gdy model spełnia próg jakości dla danego zadania, różnica w cenie staje się przekonująca. Firmy wciąż jednak chcą modeli frontier z USA do bardziej złożonych zadań.

Na początku tego tygodnia OpenAI i Anthropic ogłosiły nowe, tańsze modele, relacjonowało CNBC. Dianne Penn, szefowa działu zarządzania produktem, badań i laboratoriów w Anthropic, powiedziała stacji, że firma próbuje sprawić, by odpowiedzi jej modeli były "bardziej wydajne, żeby zużywały mniej tokenów w zależności od ustawienia wysiłku".

Waszyngton patrzy na liczniki tokenów

Zmiana przyciąga uwagę w Waszyngtonie, gdzie dwie komisje Izby Reprezentantów USA badają wpływ rosnącej adopcji chińskich modeli, podaje CNBC. Stany Zjednoczone ograniczyły chińskim firmom AI zakup najnowocześniejszych chipów przez kontrolę eksportu. Waszyngton obawia się, że zdobędą one dostęp do chipów Nvidii zdalnie przez centra danych za granicą, oraz tak zwanego "destylowania", w którym nowe modele naśladują starsze, bardziej ugruntowane.

Chińska AI to "realne ryzyko gospodarcze i bezpieczeństwa dla Stanów Zjednoczonych", powiedział CNBC Daniel Remler, starszy analityk w programie technologii i bezpieczeństwa narodowego w CNAS. "Największą obawą jest to, że integracja chińskich modeli AI wciąga kraje w chińską strefę wpływów technologicznych, która twardnieje w geopolityczne przymierze", stwierdził. Remler dodał, że szczególnie w Azji Południowo-Wschodniej może nastąpić znaczny wzrost użycia, a "wszędzie od Lagos po São Paulo i Dżakartę, gdzie przedsiębiorcy i rządy szukają tanich, otwartych modeli, najpierw spojrzą na chińską AI".

Nvidia próbuje zmienić ten rachunek oprogramowaniem, nie chipami. Firma przygotowuje darmowy model, który ma się nazywać Nemotron 4, z terminem do końca roku. Jest skierowany do nabywców, którzy już używają sprzętu Nvidii, powiedział Rest of World Marc Einstein, analityk w Counterpoint Research. Niewiele krajów pasuje do tego opisu lepiej niż Zjednoczone Emiraty Arabskie, których flagowe centrum danych będzie działać na 400 000 chipów Nvidii, relacjonowała publikacja. Nvidia zgodziła się też zapłacić prawie 13 000 000 000 dolarów za zakup Hugging Face, platformy, na której deweloperzy udostępniają i pobierają modele, podaje Rest of World.

Kontekst tych wydatków: wcześniejsze wersje amerykańskich modeli AI pozostawały daleko za chińskimi darmowymi modelami, które w tym roku pobrano około 2 000 000 000 razy, znacznie przed każdym zachodnim rywalem, zgodnie z sierpniowym raportem Hugging Face przywołanym przez Rest of World. Rządy budujące własne modele w większości wychodzą od darmowego modelu Meta lub Alibaby. Einstein powiedział, że wydatki Nvidii mają sprawić, by zamiast tego wybierały Nemotron jako podstawę.

Czego nie pokazują benchmarki

Nic z tego nie rozwiązuje zasadniczego problemu z pomiarem. Wyniki modelu w benchmarkach nie mówią nic o tym, czy wie, co stało się po jego dacie odcięcia. Strona stale.jock.pl proponuje prosty test: zapytać model wprost o datę odcięcia danych treningowych. Dobrze zachowujący się model odpowiada albo mówi, że nie jest pewien. Ten, który wymyśla pewną datę, powiedział o sobie coś użytecznego, argumentuje strona. Dodaje, że odpowiedź trzeba sprawdzić w trackerze, bo model jest słabym źródłem na temat modeli.

Strona udostępnia też eksport czytelny maszynowo, models.json, zawierający datę wydania, opublikowaną datę odcięcia i link do źródła dla wszystkich 20 modeli. Sugeruje skierowanie agenta do niego przez plik instrukcji AGENTS.md lub CLAUDE.md, który agent już czyta. Eksport jest generowany na nowo, gdy strona jest odświeżana, więc agent czyta dzisiejsze daty, a nie te wpisane w jego wagi.

To rozwiązanie doraźne, nie naprawa. Laboratoria kontrolują, co ujawniają, a połowa aktualnych modeli w trackerze wciąż nie ma opublikowanej daty odcięcia. Dopóki się to nie zmieni, każdy, kto porównuje modele wyłącznie po benchmarkach, ocenia migawkę, która była nieaktualna już w chwili premiery.

Komentarze 0

Źródła

3
  1. 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN
  2. 02Chinese AI models surge in global popularity — and Washington is worriedEN
  3. 03Nvidia's free AI model could push the UAE closer to the U.S.EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.