Un seul noyau prédictif, sept mondes différents
L'équipe de JEPA-Anything a montré qu'une même architecture prédictive peut apprendre la dynamique de cellules, de molécules, de fluides et de planètes, sans qu'on lui fournisse les lois de la physique.

L'apprentissage automatique se spécialise d'ordinaire. Des réseaux distincts prédisent les images suivantes d'une vidéo, les mouvements d'un manipulateur, la météo ou les trajectoires de molécules. L'équipe de JEPA-Anything a posé la question inverse. Existe-t-il un principe unique de construction d'un modèle prédictif, applicable à des systèmes radicalement différents ?
Qu'est-ce qu'un modèle du monde
Un modèle du monde, dans cette approche, est un réseau qui construit un état interne à partir de l'information disponible, puis prédit avec cet état un autre état du même système. Cet autre état peut être le futur, une partie masquée de l'espace, un autre point de vue ou l'effet d'une intervention. La famille JEPA (Joint-Embedding Predictive Architecture) prédit dans l'espace des représentations, pas dans les pixels bruts. La capacité du modèle sert ainsi à la structure qui prédit réellement quelque chose, et non à reproduire des textures et du bruit.
Le problème surgit quand des échelles et des rythmes de changement différents se retrouvent dans un même objectif de prédiction. Les signaux faciles et forts occupent alors l'essentiel de la capacité, et les changements subtils mais importants se trouvent évincés. Les auteurs répondent avec un mécanisme, OPF (orthogonal predictive factorization), qui découpe l'état cible en sous-espaces complémentaires traités par des branches de prédiction séparées, puis les réassemble. Un ensemble de contraintes, l'orthogonalité des facteurs, leur activité et la variance de l'encodeur, doit empêcher les branches d'apprendre la même chose et protéger contre l'effondrement des représentations. Les facteurs ne sont pas assignés d'avance à des grandeurs physiques précises : c'est la structure des données qui décide de ce qu'ils représentent.
Un test sur sept systèmes
Les auteurs ne se sont pas limités à la vidéo ni au contrôle. Ils ont éprouvé le même noyau prédictif dans sept domaines : vision, biologie, trajectoires cliniques, contrôle, dynamique moléculaire, champs physiques et météo. Chaque domaine garde sa méthode d'observation, sa construction de la paire contexte-cible et son encodeur. La couche de prédiction et une interface unifiée d'état caché sont communes.
Dans un environnement contrôlé, une version interventionnelle de Pong, le modèle a été entraîné uniquement sur des données à changement unique, puis testé sur des combinaisons inconnues de facteurs. Sur la distribution d'entraînement, l'erreur de prédiction a baissé d'environ 11,7 pour cent par rapport au JEPA standard. Sur les combinaisons inédites, l'erreur quadratique moyenne a diminué d'environ 3,5 pour cent. L'amélioration est apparue dans les cinq paires de tirages.
Dans le « Matched Dynamics Benchmark », les deux architectures ont reçu des données, un encodeur, un squelette de transition d'état, un budget de calcul et un découpage d'évaluation identiques. JEPA-Anything a amélioré le résultat dans neuf tâches sur dix, notamment de 39,7 pour cent sur l'équation de Burgers, de 39,3 pour cent sur l'équation des eaux peu profondes et de 10,5 pour cent sur WeatherBench 2. Les prédictions longues, pas à pas, où les résultats propres reviennent en entrée, ont été testées séparément.
L'exemple le plus parlant concerne l'astronomie. Le modèle a reçu des positions et des vitesses simulées de planètes, sans information sur les lois de Kepler. L'analyse des motifs internes de prédiction a révélé une dépendance de la fréquence orbitale au demi-grand axe de pente -1,4991, pour une valeur théorique de -1,5 donnée par la troisième loi de Kepler, avec un coefficient d'ajustement R² égal à 0,99999999.
En biologie, les facteurs appris par le modèle ont servi à proposer une intervention combinant des cytokines avec un blocage par anticorps. L'idée a passé les étapes suivantes de vérification : sur des lignées cellulaires, des organoïdes issus de patients et chez la souris. La dynamique moléculaire a été testée sur l'eau liquide, le quartz alpha, le paracétamol et le benzène. La conclusion des auteurs est prudente mais nette : il ne s'agit pas de remplacer le savoir de domaine, mais d'offrir une couche commune d'apprentissage de la prédiction sur laquelle ce savoir peut se construire.
Sources
2- 01量子位: AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水ZH
- 02JEPA-Anything: Learning Predictive Models across Different WorldsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.