Data wydania to nie cała historia: cutoffy treningowe i dane o adopcji na nowo określają benchmarki modeli AI
Dziesięć z 20 aktualnych modeli AI z stale.jock.pl ma cutoff treningowy, który publikuje samo laboratorium. Na OpenRouterze modele chińskie poszły z 6%-13% tokenów w lutym 2026 do 57%-67% w tygodniu 14 września. Żadnej z tych liczb nie ma w standardowej tabeli benchmarków.

Tabela benchmarków mówi, ile punktów zdobył model. Nie mówi, kiedy model przestał czytać. Luka między datą wydania z wpisu premierowego a cutoffem treningowym ukrytym w karcie modelu to dziś jedna z bardziej użytecznych liczb, które kupujący może sprawdzić. Na niej opiera się małe narzędzie opublikowane 16 września na stale.jock.pl pod tytułem "How stale is your AI?".
Strona wymienia 20 aktualnych modeli z 8 laboratoriów i zestawia każdą datę wydania z cutoffem treningowym. Oba liczy w górę. Dziesięć z 20 ma cutoff, który laboratorium faktycznie publikuje. Pięć z ośmiu laboratoriów, Anthropic, Google DeepMind, Meta, OpenAI i xAI, ma opublikowany cutoff dla co najmniej jednego modelu z listy. Reszta jest oznaczona jako "Not established". Strona starannie zaznacza, że nie jest to dowód, że laboratorium nigdy go nie opublikowało, tylko że sprawdzone źródła producenta go nie ujawniły.
Niektóre luki są duże.
GPT-6 Astra, wydany przez OpenAI 3 września 2026, ma cutoff treningowy 30 kwietnia 2026. W dniu premiery był już cztery miesiące do tyłu. Gemini 3.1 Pro, wydany 19 lutego 2026, kończy się na styczniu 2025, czyli ponad rok luki. Claude Sonnet 5, wydany 30 czerwca 2026, ma cutoff ze stycznia 2026; Claude Opus 5.5, wydany 22 września 2026, ma czerwiec 2026. Llama 4 od Meta, wydana 5 kwietnia 2025, ma cutoff z sierpnia 2024.
Główny argument strony jest taki, że wyszukiwarka tego nie naprawia. Gdy model przeszukuje sieć, czyta kilka stron, używa ich do jednej odpowiedzi i zapomina, twierdzi strona. Wyszukiwanie musi też wywołać sam model, tymi samymi wagami, które trzymają nieaktualny fakt. Pomyłki skupiają się więc tam, gdzie model jest najbardziej pewny siebie. Autor opisuje, jak przepuścił 16 modeli przez narzędzie wyszukiwania w sieci w ponad 2 000 wywołań. Modele czołowe prawie zawsze decydowały się szukać poprawnie. Słabsze odpowiadały na ustalone pytania z pamięci po tym, jak odpowiedź się zmieniła, i szukały w sieci rzeczy takich jak temperatura wrzenia wody. W jednym z przykładów pięć z 16 modeli wskazało zmarłego człowieka jako króla Norwegii.
Nic z tego nie jest recenzowane. Strona to projekt Show HN, liczby pochodzą z własnego stanowiska testowego autora, a lista modeli to migawka, nie spis. Zasadniczy punkt nie zależy jednak od tego, czy eksperyment się obroni. Model, który zadebiutował we wrześniu z cutoffem z kwietnia, myli się co do września w sposób, którego wynik benchmarku nie pokaże.
W tym samym tygodniu jest drugi, trudniejszy do zignorowania sygnał. Dotyczy tego, jakie modele ludzie faktycznie uruchamiają. CNBC podało 26 września, że modele chińskie przeszły z małego udziału w użyciu do większościowego na dwóch bramach dla deweloperów. Na OpenRouterze odpowiadały za 57% do 67% tokenów w tygodniu 14 września, w górę z 6% do 13% w lutym. Na Vercelu ich udział wzrósł do 55% w sierpniu z 11% w styczniu.
Dane OpenRoutera obejmują firmy ze Stanów Zjednoczonych, Europy i tego, co określa jako "Global South", 82 kraje w Ameryce Środkowej i Południowej, Afryce i Azji. Vercel nie podał podziału geograficznego. Ten sam raport zauważa, że modele czołowe ze Stanów Zjednoczonych wciąż przyciągają więcej wydatków ogółem. Udział w tokenach i udział w przychodach wskazują więc w różnych kierunkach.
Peter Walker, szef działu analiz w OpenRouterze, powiedział CNBC, że chińskie modele open source wydane w tym roku "mogą wiarygodnie działać w zaawansowanych zastosowaniach agentowych, zwłaszcza w kodowaniu, w sposób, który pod koniec 2025 roku po prostu nie był prawdą". Dodał, że są "niesamowicie opłacalne w porównaniu z większością modeli z amerykańskich laboratoriów". Harpreet Arora, szef infrastruktury agentowej w Vercelu, ujął mechanizm wprost: gdy model spełnia próg jakości dla danego zadania, różnica w cenie staje się przekonująca.
Waszyngton to zauważa. Dwie komisje Izby Reprezentantów badają rosnącą adopcję chińskich modeli. CNBC opisuje obawy o zdalny dostęp do chipów Nvidii przez zagraniczne centra danych i o destylację, w której nowsze modele naśladują starsze. Daniel Remler z Center for a New American Security powiedział CNBC, że "największą obawą jest to, że integracja chińskich modeli AI wciąga kraje w chińską strefę wpływów technologicznych, która twardnieje w geopolityczne przyporządkowanie".
Postaw obie historie obok siebie, a pytanie o benchmark zmienia kształt.
Ranking mierzy model na ustalonym zestawie zadań w dniu testu. Nie mierzy, jak daleko wiedza modelu odbiegła od teraźniejszości, i nie mierzy, czy kogokolwiek stać na uruchamianie go na dużą skalę. Strona stale.jock.pl twierdzi, że modele są słabym źródłem na swój temat. Proponuje skierować agenta do czytelnego maszynowo pliku models.json, zanim ten wskaże jakikolwiek model, wersję czy datę jako aktualne. To drobna poprawka. Większy problem polega na tym, że domyślny dowód branży, tabela benchmarków, milczy zarówno o świeżości, jak i o cenie.
Nvidia obstawia pokrewną stawkę, według Rest of World. Firma wydała 7 000 000 000 dolarów w zeszłym miesiącu na udział w amerykańskim startupie koderskim Poolside i licencję na jego narzędzia do budowania modeli, a zgodziła się zapłacić prawie 13 000 000 000 dolarów za Hugging Face. Jej własny darmowy model, który ma się nazywać Nemotron 4, ma być gotowy do końca roku. Raport mówi, że wcześniejsze amerykańskie modele otwarte zostawały w tyle za chińskimi darmowymi modelami, pobranymi około 2 000 000 000 razy w tym roku według sierpniowego raportu Hugging Face. Wydatki Nvidii mają uczynić Nemotrona bazą, którą wybierają rządy, zamiast modelu Meta albo Alibaby.
Zjednoczone Emiraty Arabskie są przypadkiem testowym. Ich flagowe centrum danych będzie działać na 400 000 chipów Nvidii, a G42, spółka AI wspierana przez państwo, dołączyła do sojuszu otwartych modeli Nvidii w lipcu. Technology Innovation Institute, które zbudowało Falcona, zajmuje drugą stronę. "Jako laboratorium budujące modele uważamy, że utrzymanie różnorodności perspektyw w AI i zachowanie pełnej suwerenności technologicznej wymaga silnej, rodzimej podstawy", powiedział Rest of World główny badacz TII Hakim Hacid.
Żadnego z tych stanowisk nie rozstrzyga benchmark. Kraj albo firma wybierająca model bazowy wybiera łańcuch dostaw, krzywą kosztów i rytm odświeżania. Opublikowany cutoff to jedna z niewielu twardych liczb dostępnych na temat tego ostatniego.
Źródła
3- 01Show HN: How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.