Kruche decyzje: jak łatwo przewrócić poprawny wybór modelu
Cztery prace z września pokazują słabości modeli językowych: krótki, naturalnie wyglądający kontekst potrafi odwrócić poprawną decyzję, a linia między tym, co model koduje, a tym, co wykorzystuje, bywa bardzo szeroka.

Modele decyzyjne mapują tekst na rozkład prawdopodobieństwa nad skończonym zbiorem wyborów i coraz częściej sterują realnymi działaniami: kierują zgłoszenia, wybierają narzędzia, uruchamiają akcje. Praca „JevOut” zadaje pytanie, co dzieje się z taką decyzją, gdy do wejścia dołączymy krótki tekst, który naturalnie pasuje do kontekstu i nie zmienia poprawnej odpowiedzi.
Kontekst kontra odpowiedź
Autorzy obrali prostą strategię. Dla każdego początkowo poprawnego zadania ustalili jedną błędną opcję docelową, a potem optymalizowali dodatki do kontekstu tak, by pozostały płynne, a jednocześnie przesuwały wybór ku tej opcji. Źródło, pytanie, zestaw odpowiedzi ani poprawna odpowiedź nie zmieniały się. Spośród 508 początkowo poprawnych decyzji modelu Jev udało się przekierować 312, czyli 61,4 proc. W 229 przypadkach model przypisał ustalonej błędnej opcji prawdopodobieństwo co najmniej 0,7. Testy na trzech kolejnych systemach decyzyjnych dały odsetek trafnych przekierowań od 64,9 do 73,2 proc. Wniosek autorów jest ostry: skoro te modele zamieniają język bezpośrednio w decyzje, ich prawdopodobieństwa nie powinny być traktowane jako niezawodny interfejs decyzyjny.
Czy uzasadnienie cokolwiek robi
Drugi projekt bada sytuację jeszcze bardziej podstawową: model odrzuca jednego kandydata, podając fakt, którego w profilu nie było, na przykład brak reżysera albo daty śmierci. To zdanie jest sprawdzalne bez żadnego sędziego. Wystarczy wstawić do profilu zdanie z korpusu, które ten fakt podaje, i zapytać ponownie. W największym z trzech przebiegów, z sześcioma otwartymi modelami na zbiorze 2WikiMultihopQA, dostarczenie wskazywanego faktu przesunęło wybór mocniej niż dobrany długością dodatek nieistotny, z ilorazem szans 3,57 w przedziale od 1,54 do 8,26 i po korekcie Holma na poziomie 0,0210. Wynik utrzymał się po usunięciu dowolnego pojedynczego modelu.
Ale najciekawszy efekt nie dotyczy treści. Ten sam nieistotny dodatek przesuwał wybór mocniej wtedy, gdy umieszczono go przy wskazywanym rywalu, niż przy trzeciej opcji, której model nie wymienił, po korekcie Holma na poziomie 0,0008. Innymi słowy, część działania wykonuje samo umiejscowienie zdania, a nie jego treść. Autor raportuje przy tym, że walidacja reguł pomiarowych wykryła osiem usterek. Najpoważniejsza z nich, reguła parsowania wyboru, która zwracała opcję właśnie odrzuconą w 17,1 proc. rozstrzygalnych odpowiedzi, zawyżyłaby liczbę przetrwałych kontrastów z czterech do sześciu.
Liniowość i powtarzalność
Dwie kolejne prace dotyczą właściwości samych modeli. Zespół Pawła Tichonowa pokazuje, że choć transformery składają się z silnie nieliniowych elementów, wykazują fundamentalną liniowość: gdy wejścia z różnych strumieni tekstu zsumować liniowo, rozkład następnego tokenu staje się superpozycją rozkładów pojedynczych strumieni. Autorzy nazywają to hipotezą liniowości superpozycji i argumentują, że jest to właściwość architektury, a nie efekt treningu. W miarę uczenia wstępnego zjawisko słabnie, a lekkie dostrojenie potrafi przywrócić liniowość. Prowadzi to do ciekawego zastosowania: sterowane dekodowanie pozwala rozplątać superpozycję i wygenerować dwie spójne kontynuacje z jednego przejścia w przód.
Ostatnia z prac dotyczy degeneracji tekstu, czyli powtarzania się modelu. Autor nie rozstrzyga sporu między wyjaśnieniem danych a wyjaśnieniem sieci, tylko prowadzi pomiar innego rodzaju: strukturę punktów stałych mapy największego prawdopodobieństwa w krótkim oknie, na 96 losowych dwutokenowych startach i siedemnastu gotowych modelach. Klasa zachowania okazała się stabilna w siedemnastu z siedemnastu przypadków, ale przy ustalonym korpusie i skali nie jest przesądzona: jedne rodziny tworzą lejki, inne nie. Osiem z siedemnastu modeli i siedem rodzin z pięciu korpusów wykazuje lejek. Wniosek jest metodologiczny: mówienie o powtarzalności jako cesze konkretnego modelu jest przedwczesne.
Źródła
4- 01JevOut: Natural Context Can Flip Decision ModelsEN
- 02Does a model's stated reason for rejecting a candidate do any work?EN
- 03Superposition Linearity HypothesisEN
- 04What a Cross-Model Fixed-Point Census Can and Cannot Arbitrate About RepetitionEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.