Ein prädiktiver Kern, sieben verschiedene Welten
Das Team hinter JEPA-Anything zeigt: Eine gemeinsame prädiktive Architektur kann die Dynamik von Zellen, Molekülen, Flüssigkeiten und Planeten lernen, ohne dass ihr die physikalischen Gesetze vorgegeben werden.

Maschinelles Lernen folgt meist dem Weg der Spezialisierung. Ein Netz sagt die nächsten Videoframes voraus, ein anderes die Bewegungen eines Manipulators, ein drittes das Wetter, ein viertes die Trajektorien von Molekülen. Das Team hinter der Arbeit „JEPA-Anything“ stellte die umgekehrte Frage: Gibt es ein einziges gemeinsames Prinzip für den Bau eines prädiktiven Modells, das sich auf radikal verschiedene Systeme anwenden lässt?
Was ein Weltmodell ist
In dieser Sicht ist ein Weltmodell jedes Netz, das aus den verfügbaren Informationen einen inneren Zustand aufbaut und mit ihm einen anderen Zustand desselben Systems vorhersagt. Dieser „andere Zustand“ kann die Zukunft in der Zeit sein, ein verdeckter Ausschnitt des Raums, ein anderer Blickwinkel oder die Folge einer Intervention. Die JEPA-Familie (Joint-Embedding Predictive Architecture) entscheidet sich für die Vorhersage im Repräsentationsraum und nicht in rohen Pixeln. So fließt die Kapazität des Modells in die Struktur, die tatsächlich etwas vorhersagt, und nicht in die Nachbildung von Texturen und Rauschen.
Das Problem entsteht, wenn verschiedene Skalen und Änderungsraten in ein gemeinsames Vorhersageziel geraten. Dann belegen die leichteren und stärkeren Signale den größten Teil der Kapazität, und subtile, aber wichtige Veränderungen werden verdrängt. Die Autoren antworten darauf mit dem Mechanismus OPF (orthogonal predictive factorization). Er zerlegt den Zielzustand in komplementäre Unterräume, die getrennte Vorhersagezweige bearbeiten, und führt sie anschließend wieder zusammen. Ein Bündel von Nebenbedingungen soll verhindern, dass die Zweige dasselbe lernen: die Orthogonalität der Faktoren, ihre Aktivität und die Varianz des Encoders. Zugleich schützt es vor dem Kollaps der Repräsentation. Wichtig ist: Die Faktoren sind nicht von vornherein bestimmten physikalischen Größen zugeordnet. Was sie repräsentieren, entscheidet die Struktur der Daten.
Test an sieben Systemen
Die Autoren beschränkten sich nicht auf Video oder Steuerung. Denselben prädiktiven Kern prüften sie in sieben Bereichen: Vision, Biologie, klinische Trajektorien, Steuerung, Molekulardynamik, physikalische Felder und Wetter. Jeder Bereich behält seine eigene Art der Beobachtung, die Konstruktion des Paares aus Kontext und Ziel sowie einen eigenen Encoder. Gemeinsam sind die Vorhersageschicht und eine einheitliche Schnittstelle des versteckten Zustands.
In einer kontrollierten Umgebung (Pong in einer Interventionsversion) trainierte das Team das Modell ausschließlich mit Daten zu einzelnen Veränderungen und testete es auf unbekannten Kombinationen von Faktoren. Auf der Trainingsverteilung sank der Vorhersagefehler um etwa 11,7 Prozent gegenüber dem Standard-JEPA. Auf ungesehenen Kombinationen verringerte sich der mittlere quadratische Fehler um etwa 3,5 Prozent. Die Verbesserung trat in allen fünf Zufallspaaren auf.
Im „Matched Dynamics Benchmark“ erhielten beide Architekturen identische Daten, denselben Encoder, dasselbe Gerüst des Zustandsübergangs, dasselbe Rechenbudget und dieselbe Aufteilung der Bewertung. JEPA-Anything verbesserte das Ergebnis in neun von zehn Aufgaben, unter anderem um 39,7 Prozent bei der Burgers-Gleichung, um 39,3 Prozent bei den Flachwassergleichungen und um 10,5 Prozent bei WeatherBench 2. Separat getestet wurden lange Vorhersagen Schritt für Schritt, bei denen die eigenen Ergebnisse wieder in den Eingang zurückfließen.
Das aussagekräftigste Beispiel stammt aus der Astronomie. Das Modell erhielt simulierte Positionen und Geschwindigkeiten von Planeten, ohne über die Keplerschen Gesetze informiert zu werden. Die Analyse der internen Vorhersagemuster zeigte einen Zusammenhang zwischen der Orbitalfrequenz und der großen Halbachse mit einer Steigung von -1,4991 bei einem theoretischen Wert von -1,5 für das dritte Keplersche Gesetz, mit einem Bestimmtheitsmaß R² von 0,99999999.
In der Biologie wiederum dienten die vom Modell gelernten Faktoren dazu, eine Intervention vorzuschlagen, die Zytokine mit einer Antikörperblockade verbindet. Der Vorschlag durchlief weitere Prüfstufen: an Zelllinien, an Organoiden von Patientinnen und Patienten und an Mäusen. Die Molekulardynamik wurde an flüssigem Wasser, Alpha-Quarz, Paracetamol und Benzol geprüft. Das Fazit der Autoren ist vorsichtig, aber deutlich: Es geht nicht darum, Fachwissen zu ersetzen, sondern um eine gemeinsame Schicht des prädiktiven Lernens, auf der sich dieses Wissen aufbauen lässt.
Quellen
2- 01量子位: AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水ZH
- 02JEPA-Anything: Learning Predictive Models across Different WorldsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.