Data wydania to nie cutoff treningowy. Jak przestarzałe są już 20 modeli AI
Tracker opublikowany 16 września pokazuje, że dziesięć z 20 obecnych modeli AI ma cutoff treningowy, który laboratorium faktycznie podaje do wiadomości. Różnica między datą wydania a cutoffem to liczba, o której większość materiałów premierowych nie wspomina.

Strona stale.jock.pl trzyma dwie daty dla każdego modelu: dzień, w którym laboratorium go wydało, i dzień, w którym model przestał czytać. Oba liczniki tykają na żywo. O tym, co model faktycznie wie, decyduje ta druga data.
Weźmy GPT-6 Astra, wydany przez OpenAI 3 września 2026. Dane treningowe modelu kończą się 30 kwietnia 2026. W dniu premiery był już cztery miesiące do tyłu ze wszystkim, co wydarzyło się później, i będzie zostawał coraz dalej, bo gdy zmienia się świat, nic nie zmienia się w wagach. Tracker pokazuje ten sam wzorzec w całym zestawieniu. Llama 4 od Meta wydana 5 kwietnia 2025 z cutoffem z sierpnia 2024. Claude Sonnet 5 od Anthropic wydany 30 czerwca 2026 z cutoffem ze stycznia 2026. GPT-6 Sol wydany 22 września 2026 z cutoffem z 20 kwietnia 2026. Każda nazwa na stronie prowadzi do dokumentu laboratorium, z którego pochodzi data, jak podaje serwis.
Połowa listy jest pusta.
Dziesięć z 20 modeli ma opublikowany cutoff. Pozostałe dziesięć, w tym Mistral Large 3, Qwen3.8-Max, DeepSeek V4-Pro i Muse Glimmer, nie pokazuje cutoffu, bo sprawdzone źródła producentów go nie ustaliły, mówi strona. To nie dowód, że laboratorium nigdy go nie opublikowało, tylko że tracker nie mógł go znaleźć. A to inny i bardziej niewygodny fakt dla każdego, kto próbuje porównywać modele pod kątem świeżości.
Wyszukiwanie nie łata tej luki
Oczywisty zarzut jest taki, że modele przeszukują teraz sieć, więc cutoff ma mniejsze znaczenie. Autor trackera to odrzuca. Wyszukiwanie czyta kilka stron pod jedną odpowiedź i zapomina je, argumentuje strona, więc nowy czat znowu startuje z kwietnia. Co gorsza, wyszukiwanie musi uruchomić sam model, tymi samymi wagami, które trzymają nieaktualny fakt. Pomyłki trafiają więc dokładnie tam, gdzie model brzmi najpewniej. Strona przytacza test ponad 2 000 wywołań na 16 modelach, z których każdy dostał narzędzie wyszukiwania w sieci. Modele czołowe decydowały poprawnie prawie za każdym razem. Słabsze podawały fakty, które się zmieniły, bez sprawdzenia, i szukały w sieci rzeczy takich jak temperatura wrzenia wody. W jednym przykładzie pięć modeli wskazało zmarłego człowieka jako króla Norwegii.
Kryje się tu niewygodny punkt metodologiczny. Model zapytany o własny cutoff treningowy jest złym świadkiem, mówi strona, bo taki, który wymyśli pewną datę, powiedział o sobie coś użytecznego. Zalecany test jest zewnętrzny.
Tracker udostępnia te same dane jako models.json, z datą wydania, opublikowanym cutoffem i linkiem do źródła dla każdego modelu. Sugeruje wklejenie kilku linijek do AGENTS.md albo CLAUDE.md agenta, żeby agent pobrał plik, zanim nazwie jakikolwiek model lub wersję jako aktualną. Plik jest odtwarzany razem ze stroną, więc agent czyta dzisiejsze daty, a nie te zapisane w jego wagach. Lista 20 modeli obejmuje 8 laboratoriów, a 5 z nich ma opublikowany cutoff dla co najmniej jednego modelu na stronie: Anthropic, Google DeepMind, Meta, OpenAI i xAI.
Dla obserwatorów benchmarków praktyczna konsekwencja jest prosta. Ranking porównujący modele wydane kilka tygodni od siebie porównuje też modele trenowane kilka miesięcy od siebie, a różnicy nie ma w wyniku.
Źródła
1Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.