Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Benchmarki halucynacji zyskują na precyzji, gdy Gemini 4 Argon trafia do wybranych

Google w środę, 30 września, udostępnił Gemini 4 Argon, swój dotychczas najsilniejszy model, wyselekcjonowanej grupie ekspertów od cyberbezpieczeństwa. Firma wstrzymuje się z publicznym wydaniem z obaw o nadużycia.

AI i modeleAnalizaMarta ZielińskaOpublikowano: 2 października 20268 min czytaniaŹródła 13
Benchmarki halucynacji zyskują na precyzji, gdy Gemini 4 Argon trafia do wybranych

Google w środę, 30 września, udostępnił Gemini 4 Argon, swój dotychczas najsilniejszy model, wyselekcjonowanej grupie ekspertów od cyberbezpieczeństwa. Firma wstrzymuje się z publicznym wydaniem z obaw o nadużycia. W poście na blogu oświadczyła, że dobrowolnie udziela rządowi USA wczesnego dostępu i zbierze opinie testerów przed szerszą dostępnością, jak podaje The Guardian.

Ta ostrożna postawa dziwnie kontrastuje z twierdzeniami, jakie Google formułuje w odniesieniu do modelu. W blogu startowym, przytoczonym przez TechCrunch, firma stwierdziła, że Argon uzyskał znacznie wyższe wyniki niż GPT-6 Astra od OpenAI oraz Fable i Opus od Anthropic w różnych benchmarkach AI, powołując się na startup badawczy Vals. Poinformowano również, że Argon może autonomicznie znajdować, weryfikować i łatać krytyczne podatności w oprogramowaniu. To twierdzenia dotyczące możliwości, a nie wiarygodności. To dwie różne rzeczy.

Tu pojawia się kwestia halucynacji. Model, który dobrze radzi sobie w benchmarkach rozumowania lub kodowania, wciąż może generować pewne, ale błędne odpowiedzi, a najnowsze materiały dotyczące halucynacji w dokumentacji wskazują na oba kierunki. Kontrolowany audyt metryk konfliktu gradientów w zunifikowanych modelach multimodalnych, złożony na arXiv 29 września, jest bardziej interesujący z ostatnich prac. Sprawdzamy, czy powszechnie stosowana metryka pośrednia rzeczywiście przewiduje to, co badacze zakładują. Wynik jest negatywny.

Autorzy zbudowali stanowisko testowe GRIDUMM, które odzwierciedla kluczowe elementy strukturalne treningu zunifikowanych modeli multimodalnych, pozwalając na dokładne obliczenie kompromisu między rozumieniem a generowaniem. W przypadku 63 konfiguracji i 372 zmierzonych punktów kontrolnych żadna metryka konfliktu kierunkowego nie osiągnęła absolutnej korelacji Spearmana 0,3 z przedziałem ufności wykluczającym zero. Interwencja dawkowo-odpowiedziowa, która monotonicznie tłumi konflikt, pozostawiła kompromis bez zmian, oddzielając korelację od przyczynowości. Pomiarowe funkcjonalne interferencje przewyższyły metryki konfliktu kierunkowego, a strata treningowa silnie śledziła kompromis. Autorzy nie twierdzą, że konflikt jest bezużyteczny. Twierdzą, że jego ważność jako celu diagnostycznego musi być ustalona, a nie zakładana.

To wąski wynik dotyczący wąskiej klasy modeli. To również typ odkrycia, które powinien skłonić do refleksji każdego czytelnika rankingów.

Czego naprawdę mierzą nowsze benchmarki

Dwie inne prace na arXiv opublikowane w tym samym oknie czasowym podejmują podobnie sceptyczny ton. ChartDensity-Bench, złożony 30 września, ocenia multimodalne duże modele językowe pod kątem odtwarzania danych liczbowych z wykresów naukowych w kontrolowanej gęstości wizualnej, zmieniając liczbę wykresów wyświetlanych jednocześnie dla k równego 1, 3, 6 i 9. Eksperymenty na pięciu ostatnich MLLMach pokazują, że odtwarzanie danych liczbowych pogarsza się wraz ze wzrostem gęstości wizualnej, a skala tego pogorszenia znacznie różni się między modelami. Porównania parowe na poziomie wykresów w pracy wykazały, że ten sam wykres źródłowy może ponosić wyższy błąd odtwarzania, gdy jest osadzony w gęstszym kontekście wizualnym. To tryb awarii blisko halucynacji z czystym pomiarem. Model nie odmawia. Generuje liczby.

Trzecia praca, Reverse Scoring for Diffusion Language Model Agents, złożona 29 września, śledzi konkretną awarię w agentach opartych na modelach językowych dyfuzyjnych. Popadają one w pętle ponawiania, ponownie wydając akcję długo po tym, jak się nie powiodła. Autorzy przypisują to dekodowaniu maskowanemu, które angażuje pozycje, co do których ma największą pewność, a zwleka z niepewnymi, więc w stanie awarii kontekst już oferuje pewne wypełnienie dla odroczonej decyzji, mianowicie samą nieudaną akcję. Modelują to zniekształcenie jako ślepe na zadanie zniekształcenie i proponują rozwiązanie bez treningu nazwane Reflect Reverse, które oceniają na czterech wieloturnusowych benchmarkach wcielenia.

Przebiega tu wzorzec. Każda z tych trzech prac izoluje konkretny sposób, w jaki model może być pewny, ale błędny, mierzy go w kontrolowanych warunkach i stwierdza, że popularna metryka pośrednia nie śledzi wyniku. Żadna z nich nie oferuje ogólnego punktu za halucynację. Wszystkie sugerują, że ogólne punkty za halucynację wykonują mniej pracy, niż sugerują ich wydawcy.

Dla poczucia, jak bardzo benchmark może przesunąć dyskusję, spójrzmy na przestrzeń modeli decyzyjnych. InfoQ poinformowało, że TypeSafe AI wydało Jev, które w ogóle nie generuje tekstu, ale zwraca typowane, probabilistyczne decyzje z wartością pewności, więc kod wywołujący może działać powyżej progu i eskalować poniżej niego. Koszt wejścia wynosi 0,042 USD za milion tokenów, wyjście jest darmowe, okno kontekstowe to 32 000 tokenów, a TypeSafe podaje opóźnienie końcowe od 70 ms do 500 ms. Vercel dodał Jev do AI Gateway drugiego dnia i stwierdził, że w ciągu 24 godzin objął prawie 13% płatnych zespołów, dwukrotnie więcej niż rodzina GPT-5.6.

Amazon poszedł za nim. TechCrunch poinformowało 1 października, że AWS wydał Strands Decider 2B, otwarty model decyzyjny inspirowany Jev, zbudowany na rdzeniu Qwen3.5-2B. Rozdziela on między wcześniej ustalone opcje i zwraca miarę pewności. Inżynier Amazon Marc Brooker powiedział TechCrunch, że model krótko zajął pierwsze miejsce w rankingu Jevbench dla modeli swojej wielkości, a jego atrakcyjność polega na kroku w przepływie pracy, który jest bardziej wiarygodny dzięki punktom pewności i zamkniętej domenie odpowiedzi, przy niższym opóźnieniu i potencjalnie niższym koszcie.

Założyciel TypeSafe Diogo Almeida był bez owijania w bawełnę w kwestii zatłoczenia. „Rozumiem, że ludzie myślą, że to gorączka złota, ale mogą niedoszacowywać trudności w tworzeniu modeli, które są naprawdę mądre”, powiedział TechCrunch. Obecna partia, jak stwierdził, „wygląda bardziej jak” fala imitatorów. Czy to się utrzyma, czy nie, kierunek jest jasny: niektórzy twórcy odpowiadają na problem wiarygodności zawężając przestrzeń wyjściową, a nie obiecując lepszy model ogólny.

Argument bezpieczeństwa przybywa przed dowodami

Własne ujęcie Google ograniczenia Argon polega na tym, że zdolności graniczne na tym poziomie wymagają podejścia etapowego. Koray Kavukcuoglu, główny architekt AI w Google, napisał o tym w poście na blogu ogłaszającym model. Google stwierdziło, że Argon został zaprojektowany tak, aby odmawiać żądań, które mogłyby pomóc w przeprowadzeniu cyberataków lub rozwoju broni chemicznej, biologicznej lub jądrowej, i że monitoruje rozumowanie modelu, aby zapobiec odchyleniu się od tego, czego użytkownicy zamierzali, ryzyko, które badacze nazywają niezgodnością.

The Guardian poinformowało, że ostrożne wdrażanie odzwierciedla Anthropic, które utrzymywało Claude Mythos Preview w ograniczeniu do małej liczby zaufanych organizacji. W Waszyngtonie krótko zmuszono Anthropic do zawieszenia dostępu do publicznie wydanych modeli Claude Mythos i Claude Fable w czerwcu, a od tamtej pory ustanowiono dobrowolny proces weryfikacji najsilniejszych modeli AI przed wydaniem. Ogłoszenie nastąpiło dzień po tym, jak Donald Trump gościli szefów firm technologicznych, w tym Sundara Pichai i Dario Amodei z Anthropic, w Białym Domu, gdzie podpisali dobrowolny układ zobowiązujący do pilnowania ryzyka własnych systemów AI.

Google stwierdziło, że wczesni testerzy użyli Argon do wykrycia wady w oprogramowaniu używanym przez szpitale na całym świecie, która narażała wrażliwe informacje osobiste, czego inne zaawansowane modele nie zauważyły. To jedna anegdota, od dostawcy, o modelu nie będącym w ogólnej obiegu. Traktuj to jako twierdzenie o możliwościach ze strony zainteresowanej.

Walka o pochodzenie toczy się równolegle. CNBC poinformowało, że OpenAI stwierdziło, że zidentyfikowało i zakłóciło skoordynowaną kampanię mającą na celu ekstrakcję chronionego rozumowania z jego modeli, łącząc rdzeń tej aktywności z chińskim startupem Moonshot AI. Aktywność rozpoczęła się na początku lipca i wzrosła do 16 000 żądań od ponad 4 000 użytkowników w ciągu dwóch dni, z powiązaną aktywnością wśród ponad 15 000 użytkowników. OpenAI stwierdziło, że operatorzy nie naruszyli jego szyfrowania, baz danych ani przechowywanych rozmów użytkowników, i że w pełni zakłócił kampanię do 28 lipca.

The Register odnotował niezręczność skargi, biorąc pod uwagę własną historię OpenAI w treningu na danych sieciowych, i poinformował, że The Register zapytało OpenAI, które z jego modeli były celem w lipcu, i nie otrzymało odpowiedzi. Poinformowano również, że Michael Kratsios, asystent Trumpa ds. nauki i technologii, oskarżył w końcówce lipca Moonshot AI o stworzenie modelu Kimi K3 przez destylację Fable od Anthropic. Claude Opus 5.5 od Anthropic, wydany tydzień przed tą informacją, wyposażony jest w obronę przed destylacją zwaną preserved thinking, wprowadzoną wraz z Fable 5.1.

Moonshot nie odpowiedział natychmiast na prośby CNBC o komentarz, a The Register stwierdziło, że również nie otrzymało natychmiastowej odpowiedzi. Tak więc centralne oskarżenie pozostaje jednostronne w publicznych zapisach.

Innym wątkiem wartym obserwacji jest to, skąd pochodzą dane treningowe i na jakich warunkach. The Guardian poinformowało 1 października, że Anthropic wezwało rząd Albanse'a do rozważenia warunkowego zatwierdzenia treningu na australijskich dziełach chronionych prawem autorskim w modelu opt-out, po tym jak uznało, że nie zapewni powszechnego zwolnienia z praw autorskich. ABC i SBS zaprotestowały w wnioskach do parlamentarnego śledztwa federalnego, przy czym ABC ostrzegało przed kanibalizacją australijskiego przemysłu informacyjnego, a obie stacje sugerowały, aby firmy AI były uwzględnione w bodźcach negocjacyjnych dotyczących wiadomości.

Wniosek Anthropic twierdził, że technologia może przekształcić australijską gospodarkę, jednocześnie ostrzegając przed poważnymi konsekwencjami dla bezpieczeństwa narodowego, odporności infrastruktury krytycznej i bezpieczeństwa publicznego. Wspólny komitet selektywny ds. AI prowadzi posiedzenia w Sydney w przyszłym tygodniu, z udziałem dyrektorów Anthropic i OpenAI.

Nic z tego nie rozstrzyga, czy dany model jest wiarygodny. Sugeruje jednak, że branża wydaje teraz twierdzenia o wiarygodności szybciej niż sposoby ich sprawdzenia, a te sprawdziany, które istnieją, bywają wąskie, kontrolowane i niekorzystne dla metryk pośrednich, których wszyscy cytują.

Komentarze 0

Źródła

13
  1. 01Google rolls out new Gemini AI model but restricts access over safety concernsEN
  2. 02Google releases Gemini 4 Argon, called its most powerful model yetEN
  3. 03Does Gradient Conflict Predict the Understanding-Generation Trade-off? A Controlled Audit of Conflict-Metric Validity in Unified Multimodal ModelsEN
  4. 04ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual DensityEN
  5. 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Amazon releases its own Jev clone as decision models flood the webEN
  8. 08AI race heats up as OpenAI flags alleged model-copying campaignEN
  9. 09Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  10. 10Anthropic pushes for opt-out model for Australian content as ABC warns of 'cannibalisation' of newsEN
  11. 11Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  12. 12Ideogram says its new model can edit part of an image without messing up the restEN
  13. 13ThreatsDay: AI-Powered Zero-Day Chain, 543K Live Secrets, Model Inspection RCE and 13 More StoriesEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.