同一个预测核心,七个不同的世界
JEPA-Anything 团队发现,同一套预测架构能学会细胞、分子、流体和行星的动态,事先并不需要告诉它任何物理定律。

机器学习通常走专业化的路。有的网络预测视频的下一帧,有的预测机械臂的动作,有的预测天气,还有的预测分子轨迹。JEPA-Anything 这篇工作的作者反过来问:有没有一条统一的建模原则,能用来处理差别极大的系统。
什么是世界模型
在这套说法里,世界模型指的是任何一种网络:它根据手头的信息建立内部状态,再用这个状态去预测同一系统的另一个状态。这个“另一个状态”可以是时间上的未来,可以是被遮住的一块空间,可以是另一个视角,也可以是某次干预的结果。JEPA(Joint-Embedding Predictive Architecture)这一族选择在表示空间里做预测,不在原始像素上做。模型的容量因此用在真正能预测的结构上,而不是用来还原纹理和噪声。
问题出在不同尺度和不同变化速度被塞进同一个预测目标的时候。更容易、更强的信号会占掉大部分容量,细微但重要的变化则被挤掉。作者用 OPF(orthogonal predictive factorization)来应对:把目标状态切成互补的子空间,交给各自独立的预测分支处理,再合并回去。一组约束用来防止各分支学到同样的东西,也防止表示塌缩,包括因子的正交性、因子活跃度以及编码器方差。这些因子并没有事先对应到某个具体的物理量,它们代表什么由数据结构决定。
在七个系统上的测试
作者没有只做视频或控制。同一个预测核心在七个领域做了检验:视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气。每个领域保留自己的观测方式、自己的上下文与目标配对方式、自己的编码器。共用的是预测层和统一的隐状态接口。
在受控环境里(干预版的 Pong),模型只用单因素变化的数据训练,却在没见过的因子组合上测试。在训练分布上,预测误差比标准 JEPA 下降约 11.7%。在没见过的组合上,均方误差下降约 3.5%。五组随机划分里都出现了改善。
在 Matched Dynamics Benchmark 里,两种架构拿到完全相同的数据、编码器、状态转移骨干、算力预算和评估划分。JEPA-Anything 在十项任务中的九项上更好,包括 Burgers 方程上提升 39.7%,浅水方程上提升 39.3%,WeatherBench 2 上提升 10.5%。作者还单独测试了长程逐步预测,把自身输出送回输入。
最能说明问题的是天文学的例子。模型只拿到模拟的行星位置和速度,没有被告知开普勒定律。对内部预测模式的分析显示出轨道频率与半长轴之间的依赖关系,斜率为 -1.4991,而开普勒第三定律的理论值是 -1.5,拟合优度 R² 为 0.99999999。
在生物学方面,模型学到的因子被用来提出一种干预方案,把细胞因子与抗体阻断结合起来。这个想法经过了后续验证:在细胞系、来自患者的类器官以及小鼠身上。分子动力学则在水、α 石英、对乙酰氨基酚和苯上做了检验。作者的结论谨慎但明确:这不是要取代领域知识,而是提供一个共同的预测学习层,知识可以建在这层之上。
资料来源
2- 01量子位: AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水ZH
- 02JEPA-Anything: Learning Predictive Models across Different WorldsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。