Nowe modele AI wyprzedzają własne dane treningowe
Dziesięć z 20 modeli AI z trackera stale.jock.pl ma datę odcięcia treningu, którą laboratorium faktycznie publikuje. Kilka zadebiutowało miesiące po dacie z własnego ogłoszenia o premierze.

Strona trafiła na Hacker News 16 września. Dla każdego modelu śledzi dwie daty: dzień premiery i dzień, w którym model przestał czytać. Na liście jest 20 modeli z 8 laboratoriów, a licznik przy każdej dacie odlicza w górę na bieżąco, w przeglądarce.
Właśnie ta różnica jest sednem sprawy. GPT-6 Astra, wydany przez OpenAI 3 września 2026, ma datę odcięcia treningu 30 kwietnia 2026. Jego brat GPT-6 Sol trafił na rynek 22 września z odcięciem 20 kwietnia, a GPT-6 Luna tego samego dnia z odcięciem 18 maja. Claude Opus 5.5 od Anthropic, wydany 22 września, kończy się na czerwcu 2026. Claude Sonnet 5, dostępny od 30 czerwca, przestał czytać w styczniu.
Dla połowy listy odpowiedź jest po prostu nieznana. Large 3, Small 4 i Medium 3.5 od Mistral AI, Qwen3.8-Max i Qwen3.8-Flash od Alibaby, Muse Glimmer i Muse Spark 1.3 od Meta, V4-Pro i V4.1-Flash od DeepSeek oraz Gemini 3.8 Flash od Google DeepMind nie mają ustalonego odcięcia. Strona ostrożnie opisuje, co to znaczy: puste pole to wynik tego, czego sprawdzone źródła dostawcy nie ustaliły, a nie dowód, że laboratorium nigdy go nie opublikowało.
Dlaczego data znaczy więcej niż numer wersji
Sama strona ujmuje to bez ogródek. Model może zadebiutować we wrześniu, a mimo to przestać czytać w kwietniu. W dniu premiery jest więc pięć miesięcy do tyłu, jeszcze zanim ktokolwiek wpisze w niego prompt.
Narzędzia wyszukiwania tego nie naprawiają, czytamy na stronie. Gdy model szuka, czyta kilka stron, używa ich w jednej odpowiedzi i zapomina. Otwórz nowy czat, a odcięcie wraca. Decyzja o sięgnięciu po wyszukiwanie zapada na tych samych wagach, które przechowują nieaktualny fakt. Pomyłki trafiają więc tam, gdzie model jest najbardziej pewny siebie. Strona podaje, że zmierzyła to w 2 000 wywołań na 16 modelach, z których każdy dostał narzędzie wyszukiwania w sieci. Modele czołowe decydowały poprawnie niemal za każdym razem. Słabsze podawały ustalone fakty, które się zmieniły, i szukały w sieci temperatury wrzenia wody.
Dałem 16 modelom AI przycisk wyszukiwania i zapytałem, kto jest królem Norwegii. Pięć wskazało zmarłego człowieka.
To zdanie ze strony i najczystsza ilustracja problemu. Model, który nie wie, że monarcha zmarł, nie zdecyduje wiarygodnie, że ma to sprawdzić.
Obejście jest pomyślane dla agentów, nie dla ludzi
Strona publikuje te same dane jako models.json, z datą wydania, opublikowanym odcięciem i linkiem do źródła przy każdym modelu. Proponuje wklejenie krótkiego bloku instrukcji do pliku AGENTS.md lub CLAUDE.md, żeby agent pobrał je, zanim wskaże jakikolwiek model jako obecny.
Po stronie laboratoriów opublikowane odcięcia są nierówne. Pięć z ośmiu laboratoriów, Anthropic, Google DeepMind, Meta, OpenAI i xAI, ma opublikowane odcięcie dla co najmniej jednego modelu z listy. Dziesięć z 20 modeli je ma. Reszta nie.
Strona proponuje też prosty test: zapytaj model o jego własną datę odcięcia treningu. Ten, który odpowie albo przyzna się do niepewności, zachowuje się dobrze. Ten, który wymyśli pewną datę, właśnie coś zdradził. Ostrzeżenie na stronie jest takie, że model jest słabym źródłem o modelach, więc sprawdź odpowiedź z tabelą, zamiast jej ufać.
Źródła
1Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.