Trackerów modeli przybywa, a daty wydania i granice treningu się rozjeżdżają
Tracker opublikowany 16 września wymienia 20 aktualnych modeli AI z 8 laboratoriów. Pokazuje, ile czasu mija między dniem premiery a dniem, w którym model przestał czytać. Tylko 10 z 20 ma granicę treningu, którą laboratorium rzeczywiście podaje.

Strona stale.jock.pl trzyma po dwie daty na model: datę wydania, czyli dzień, w którym laboratorium go wypuściło, oraz granicę treningu, czyli dzień, w którym model przestał czytać. Oba liczniki odbijają na żywo. Autor ujmuje to bez ogródek: model może trafić na rynek we wrześniu, a mimo to przestać czytać w kwietniu. W dniu premiery jest więc pięć miesięcy do tyłu.
Lista jest konkretna. Llama 4 trafiła na rynek 5 kwietnia 2025 roku z granicą treningu z sierpnia 2024. Claude Haiku 4.5 trafił 15 października 2025 i zatrzymuje się na lipcu 2025. Gemini 3.1 Pro trafił 19 lutego 2026 z granicą ze stycznia 2025, trzynaście miesięcy w tyle. GPT-6 Astra trafił 3 września 2026 i zatrzymuje się na 30 kwietnia 2026. GPT-6 Sol, z 22 września 2026, zatrzymuje się na 20 kwietnia 2026. GPT-6 Luna, tego samego dnia, na 18 maja 2026. Claude Opus 5.5, również z 22 września, na czerwcu 2026.
Połowa półki nie ma podanej granicy
Dziesięć modeli ma puste pole. Pięć z ośmiu laboratoriów, Anthropic, Google DeepMind, Meta, OpenAI i xAI, podaje granicę dla co najmniej jednego modelu ze strony. Puste pola ma cała pokazana linia Mistrala (Large 3, Small 4, Medium 3.5), Qwen3.8-Max i Qwen3.8-Flash od Alibaby, Muse Glimmer i Muse Spark 1.3 od Meta, DeepSeek V4-Pro i V4.1-Flash oraz Gemini 3.8 Flash. Strona ostrożnie tłumaczy, co oznacza puste pole: sprawdzone źródła producenta nie ustaliły granicy. To jeszcze nie dowód, że laboratorium nigdy jej nie podało.
Autor przeprowadził też test wyszukiwania: ponad 2000 wywołań w 16 modelach, każdy z narzędziem wyszukiwania w sieci. Modele frontier odpowiadały poprawnie niemal za każdym razem, pisze strona. Słabsze podawały ustalone fakty, które się zmieniły, i nie sprawdzały ich. Zdarzało im się też szukać w sieci rzeczy takich jak temperatura wrzenia wody. W tym samym teście pięć modeli wskazało zmarłego człowieka jako króla Norwegii.
Wyszukiwanie musi też uruchomić sam model, przy użyciu tych samych wag, które trzymają nieaktualny fakt. Pomyłki wypadają więc dokładnie tam, gdzie model czuje się najpewniej.
To argument za eksportem. Strona udostępnia models.json z datą wydania, podaną granicą i linkiem do źródła dla każdego modelu. Proponuje wklejenie kilku linii do AGENTS.md albo CLAUDE.md, które agent już czyta. Instrukcja każe pobrać plik, zanim jakikolwiek model, wersja lub data zostanie nazwana jako aktualna, i traktować wszystko z przypisaną datą jako niezweryfikowane, dopóki się tego nie sprawdzi. Plik jest generowany od nowa razem ze stroną.
Benchmarki się ruszają, daty nie
To nie jedyna próba pilnowania faktów o modelach. Osobny projekt z Show HN, Cactus Needle 3, opublikowany 18 września, proponuje modele automatyzacji o rozmiarze od 8 do 29 MB dla małych urządzeń. Twierdzi, że czterowarstwowa podsieć może dorównać DeepSeek V4 Flash, gdy dostroi się ją na jedną epokę. CUA-S1, opublikowany 19 września, to wczesne, źródłowe wydanie badawcze małych modeli decyzyjnych do pracy z komputerem. Wagi hostowane są osobno na Hugging Face, a źródło ma licencję MIT.
Żaden z tych projektów nie rozstrzyga kwestii benchmarków. Tracker mówi, kiedy model przestał czytać. Nie mówi, czy model jest dobry. Rozróżnienie ma znaczenie, bo ogłoszenia o wydaniach i twierdzenia o benchmarkach przychodzą według różnych zegarów. Data granicy treningu jest tym jednym elementem metadanych, który laboratorium może podać, nie spierając się o metodologię.
Sama rada na stronie jest okrężna i strona to przyznaje: zapytaj model wprost o jego granicę treningu. Dobrze wychowany model odpowie albo powie, że nie jest pewien. Ten, który wymyśli pewną datę, powiedział ci coś użytecznego o sobie. Potem sprawdź odpowiedź, bo model jest słabym źródłem na temat modeli.
Źródła
3- 01How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Needle 3 - 8-29 MB foundation model for tiny devicesEN
- 03trycua/cua: Scale computer-use 2.0EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.