Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Dwie daty decydują, jak nieaktualny jest model AI, a tylko 10 z 20 laboratoriów podaje obie

Strona śledząca opublikowana 16 września wymienia daty wydania i granice danych treningowych dla 20 obecnych modeli z 8 laboratoriów i na bieżąco odlicza od każdej daty. Tylko 10 z 20 ma granicę, którą laboratorium faktycznie publikuje.

AI i modeleNewsMarta ZielińskaOpublikowano: 27 września 20263 min czytaniaŹródła 1
Dwie daty decydują, jak nieaktualny jest model AI, a tylko 10 z 20 laboratoriów podaje obie

Strona stale.jock.pl pojawiła się 16 września jako zgłoszenie na Show HN. Jej założenie jest wąskie: model może trafić na rynek we wrześniu, a mimo to przestać czytać w kwietniu. Luka od dnia premiery jest więc wbudowana, zanim ktokolwiek wpisze prompt. Te same dane są udostępnione jako models.json, żeby agenci mogli je pobrać.

Pięć z ośmiu laboratoriów ma opublikowaną granicę dla co najmniej jednego wymienionego modelu: Anthropic, Google DeepMind, Meta, OpenAI i xAI. Puste miejsce w tabeli oznacza, że sprawdzone źródła producenta nie ustaliły granicy, a nie dowód, że laboratorium nigdy jej nie publikowało, pisze strona. Mistral, Alibaba i DeepSeek występują w tabeli bez ustalonej granicy dla pokazanych modeli.

Luka, model po modelu

GPT-6 Astra od OpenAI wydano 3 września 2026 roku, a dane treningowe kończą się 30 kwietnia 2026 roku. To cztery miesiące luki. GPT-6 Sol, wydany 22 września, kończy się 20 kwietnia. GPT-6 Luna, ta sama data wydania, kończy się 18 maja. Claude Opus 5.5 od Anthropic trafił na rynek 22 września z granicą czerwca 2026 roku; Claude Fable 5.1 trafił 1 września, też czerwiec 2026 roku. Llama 4 od Meta, wydana 5 kwietnia 2025 roku, ma granicę sierpnia 2024 roku.

Najdłuższe opóźnienie w tabeli należy do Gemini 3.1 Pro: wydany 19 lutego 2026 roku, granica styczeń 2025 roku, trzynaście miesięcy. Mistral Large 3, Mistral Small 4, Mistral Medium 3.5, Qwen3.8-Max, Qwen3.8-Flash, Muse Glimmer, Muse Spark 1.3, DeepSeek V4-Pro i DeepSeek V4.1-Flash są wymienione bez opublikowanej granicy, więc z tego źródła nie da się dla nich obliczyć luki.

Strona twierdzi, że wyszukiwarki nie rozwiązują problemu. Gdy model szuka, czyta kilka stron, używa ich w jednej odpowiedzi i zapomina; otwórz nowy czat i znowu jest kwiecień. Wyszukiwanie musi też wywołać sam model, tymi samymi wagami, które trzymają nieaktualny fakt. Serwis podaje pomiar ponad 2 000 wywołań w 16 modelach, każdemu dano narzędzie wyszukiwania w sieci: modele czołowe decydowały poprawnie niemal za każdym razem, a słabsze odpowiadały na rozstrzygnięte pytania z pamięci po zmianie odpowiedzi i szukały w sieci temperatury wrzenia wody. Strona podaje też, że gdy 16 modeli zapytano, kto jest królem Norwegii, pięć wskazało zmarłego człowieka.

Dlaczego brakuje drugiej liczby

W tym milczeniu jest logika handlowa. Data wydania to wydarzenie marketingowe i dostaje wpis o premierze. Granica danych to przyznanie się do tego, czego model nie wie, a laboratorium, które ją publikuje, daje konkurentom i klientom sposób na zmierzenie luki już pierwszego dnia. Wynik to dziesięć z dwudziestu.

Strona proponuje obejście dla osób budujących agentów: wpisać kilka linijek do pliku AGENTS.md lub CLAUDE.md, który agent już czyta. Ma w nich stać, żeby pobrał JSON, zanim uzna jakikolwiek model, wersję lub datę za aktualne, i żeby traktował wszystko z datą jako niesprawdzone do weryfikacji. Eksport zawiera datę wydania, opublikowaną granicę i link do źródła dla każdego modelu, a odświeża się razem ze stroną, więc agent czyta dzisiejsze daty, a nie te ze swoich wag. Sformułowanie jest na stronie, gotowe do wklejenia.

Oczywiste ograniczenie jest takie, że strona jest relacją modelu o modelach i sama to przyznaje. Jej rada, jak sprawdzić pojedynczy model, brzmi: zapytać go wprost, jaka jest jego granica danych treningowych. Dobrze zachowujący się model odpowiada albo mówi, że nie jest pewien. Ten, który wymyśla pewną datę, powiedział coś użytecznego o sobie. Sprawdź odpowiedź w tabeli, zanim jej zaufasz.

Strona nie oferuje niezależnego audytu tych 20 dat poza podlinkowanymi dokumentami laboratoriów, po jednym na model. Kto opiera na tych liczbach decyzję o wdrożeniu, powinien przejść tymi linkami, bo puste komórki najpewniej zmienią się pierwsze.

Komentarze 0

Źródła

1
  1. 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.