Jeden rdzeń predykcyjny, siedem różnych światów
Zespół stojący za JEPA-Anything pokazał, że jedna architektura predykcyjna potrafi uczyć się dynamiki komórek, cząsteczek, płynów i planet. Nikt nie podpowiadał jej praw fizyki.

Uczenie maszynowe zwykle idzie ścieżką specjalizacji. Inne sieci przewidują kolejne klatki wideo, inne ruchy manipulatora, inne pogodę, a jeszcze inne trajektorie cząsteczek. Zespół stojący za pracą „JEPA-Anything” postawił pytanie odwrotne: czy istnieje jedna, wspólna zasada budowy modelu predykcyjnego, którą da się zastosować do radykalnie różnych systemów.
Czym jest model świata
W tym ujęciu modelem świata jest każda sieć, która na podstawie dostępnej informacji buduje stan wewnętrzny i przewiduje nim inny stan tego samego systemu. Tym „innym stanem” może być przyszłość w czasie, zasłonięty fragment przestrzeni, inny punkt widzenia albo skutek interwencji. Rodzina JEPA (Joint-Embedding Predictive Architecture) wybiera przy tym przewidywanie w przestrzeni reprezentacji, a nie w surowych pikselach. Dzięki temu pojemność modelu idzie na strukturę, która faktycznie coś przewiduje, a nie na odtwarzanie tekstur i szumu.
Problem pojawia się, gdy różne skale i tempa zmian trafiają do jednego wspólnego celu predykcji. Wtedy sygnały łatwiejsze i mocniejsze zajmują większość pojemności, a subtelne, lecz istotne zmiany bywają wypierane. Autorzy odpowiadają na to mechanizmem OPF (orthogonal predictive factorization). Tnie on docelowy stan na komplementarne podprzestrzenie, którymi zajmują się osobne gałęzie predykcji, a potem scala je z powrotem. Wiązka ograniczeń, czyli ortogonalność czynników, ich aktywność oraz wariancja kodera, ma zapobiegać temu, by gałęzie uczyły się tego samego, i chronić przed zapadnięciem reprezentacji. Czynniki nie są z góry przypisane do konkretnych wielkości fizycznych. O tym, co reprezentują, decyduje struktura danych.
Test na siedmiu systemach
Autorzy nie ograniczyli się do wideo ani sterowania. Ten sam rdzeń predykcyjny sprawdzili w siedmiu dziedzinach: wizji, biologii, trajektoriach klinicznych, sterowaniu, dynamice molekularnej, polach fizycznych i pogodzie. Każda dziedzina zachowuje własny sposób obserwacji, konstrukcji pary kontekst–cel i własny koder. Wspólna jest warstwa predykcji i jednolity międzyfejs stanu ukrytego.
W środowisku kontrolowanym (Pong w wersji interwencyjnej) model trenowano wyłącznie na danych z pojedynczymi zmianami, a testowano na nieznanych kombinacjach czynników. Na rozkładzie treningowym błąd predykcji spadł o około 11,7 proc. względem standardowego JEPA, a na niewidzianych kombinacjach średni błąd kwadratowy zmalał o około 3,5 proc. Poprawa wystąpiła we wszystkich pięciu parach losowań.
W „Matched Dynamics Benchmark” obie architektury dostały identyczne dane, koder, szkielet przejścia stanu, budżet obliczeń i podział oceny. JEPA-Anything poprawiło wynik w dziewięciu z dziesięciu zadań, m.in. o 39,7 proc. na równaniu Burgersa, o 39,3 proc. na równaniu płytkiej wody i o 10,5 proc. na WeatherBench 2. Osobno testowano długie przewidywania krok po kroku, w których własne wyniki wracają na wejście.
Najbardziej wymowny przykład dotyczy astronomii. Modelowi podano symulowane pozycje i prędkości planet, nie informując go o prawach Keplera. Analiza wewnętrznych wzorców predykcji ujawniła zależność częstotliwości orbitalnej od półosi wielkiej o nachyleniu -1,4991 przy teoretycznej wartości -1,5 dla trzeciego prawa Keplera, ze współczynnikiem dopasowania R² równym 0,99999999.
W biologii z kolei czynniki wyuczone przez model posłużyły do zaproponowania interwencji łączącej cytokiny z blokadą przeciwciał. Pomysł przeszedł kolejne etapy weryfikacji: na liniach komórkowych, organoidach pochodzących od pacjentów i u myszy. Dynamikę molekularną sprawdzano na ciekłej wodzie, kwarcu alfa, paracetamolu i benzenie. Wniosek autorów jest ostrożny, ale wyraźny: nie chodzi o zastąpienie wiedzy dziedzinowej, lecz o wspólną warstwę uczenia predykcji, na której tę wiedzę można budować.
Źródła
2- 01量子位: AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水ZH
- 02JEPA-Anything: Learning Predictive Models across Different WorldsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.