AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

量子位
Sep 19

衡宇 发自 凹非寺

量子位 | 公众号 QbitAI

一篇技术报告中居然出现了两个看起来风马牛不相及的研究对象,跟着AI真是见世面。

一个是患者来源的类器官,另一个则跨越到了宏观宇宙……

先说前者。研究者利用模型学到的内部因子,提出了细胞因子联合抗体阻断的干预方案,并经细胞系、类器官、小鼠实验层层验证。

至于后者,研究者把模拟的行星位置和速度轨迹喂给模型,不告诉它开普勒定律。

等它学完后分析其内部的预测模式,提取出的“轨道频率-半长轴”关系拟合斜率达-1.4991(开普勒第三定律理论值为-1.5),且R²=0.99999999。

肿瘤研究和行星轨道计算两个八竿子打不着的领域,居然能用同一种预测学习方法来搞定。

大千世界千差万别,天气、分子、细胞、病人、机器人乃至行星,各自遵循完全不同的规律。

但AI在理解它们“如何变化”时,有没有可能共享一套更底层的方法?

最近,PhAI Labs联合牛津、斯坦福、普林斯顿、港中文等高校团队最新发布的JEPA-Anything,就在尝试回答这个问题。

论文显示,JEPA-Anything是一个面向不同“世界”学习预测模型的跨领域框架。

每个领域保留自己的观测形式、context-target构造和编码器,但共享后面的预测核心以及一套统一的latent world-state interface。

其中涉及一个叫做OPF(Orthogonal Predictive Factorization,正交预测分解)的关键机制。

可以先简单理解为:

别把世间各种各样的变化,全都堆在一块去学习建模。

给世界建模,一条预测通路可能不够

首先来厘清一个概念,在JEPA-Anything这项研究中,“世界模型”究竟意味着什么?

JEPA-Anything论文给出的定义兼具宽泛度与操作性。

论文写道,只要模型能根据现有信息(Context)建立内部状态,并以此预测同一系统中的另一个状态,均可归入隐空间世界模型(Latent World Model)的范畴。

这里的“另一个状态”,既可以是时间上的未来,也可以是空间上的隐藏区域、不同视角,甚至是施加某种干预后的结果。

顺着这一思路,业界在过去几年间已经发展出了日趋成熟的技术路径。

例如,DreamerV3强调先构建环境模型,再在模型内部“构想”行动后果;V-JEPA 2则将视频表征学习与机器人控制结合,让机械臂在规划动作前,先预测不同行为带来的物理反馈。

而JEPA——Joint-Embedding Predictive Architecture,联合嵌入预测架构——是其中颇有代表性的一条路线。

相比直接在原始空间重建目标状态,JEPA选择在表征空间做预测,不必还原每一个像素或细节。

它会将观测信息先编码为隐空间中的内部表征,再在表征空间内完成预测。

这种设计让模型把更多表征能力留给具有预测价值的结构,减少纹理、噪声等原始空间细节的干扰。

不过,标准JEPA通常让信息全部汇入同一个target embedding,走同一条预测路径。

但现实世界的变化往往不是单线程的。

举例来说,分子的整体平移往往伴随着内部原子的微观振动;宏观气象系统的缓慢演变中,夹杂着剧烈的局部扰动;生物系统则更为复杂,多尺度、多通路的变化时刻在同步发生。

当不同尺度、不同实体、不同难度的信号强行挤在一起时,那些更容易预测、变化更显著的信号,可能优先占据更多预测容量。

相比之下,那些相对微弱却同样关键的信息,要么在梯度冲突中被抵消,要么被强信号彻底掩盖。

研究人员将其归结为一个“预测容量如何分配”的问题,同时给出了新的解决思路。

既然拥挤会导致挤压,那就进行空间解耦。

于是就有了JEPA-Anything。

其核心机制OPF(正交预测分解)将原本完整的目标状态切割为多个彼此互补的子空间,交由不同的预测分支独立处理,最终再拼回完整的世界状态。

为了防止多分支演变为“多套人马学同一件事”的冗余状态,OPF引入正交约束,让不同factor尽量占据互不重叠的预测方向,减少多个分支重复学习同一类信息;同时通过因子活性约束和编码器方差约束,避免部分factor失活,并降低表示坍缩风险。

值得注意的是,这些factor并没有被预先规定“你负责速度”“你负责温度”“你负责某条生物通路”。

它们学什么由数据中的可预测结构决定。

训练完成后,这些factor也因此留下了一个可供后续分析的内部接口。

同一预测核心,跨七类系统验证

方法论说得再漂亮,最终仍需经受跨领域泛化的检验。

这就不得不提到JEPA-Anything实验设计的独到之处。

它并未局限于视频表征或机器人控制等传统领域,转而将同一套预测核心(Predictive Core)直接置于视觉、生物、临床、控制、分子、物理场和天气七类截然不同的系统中进行验证。

所谓“Anything”,并非指强行将所有领域的数据打散重构为同一种输入格式,图像、单细胞序列、分子结构乃至气象数据,依然保留各自最契合的编码器与数据形态。

它统一的是这样一套底层规则:

当数据被转换为隐空间表征之后,预测部分应当如何搭建模型、如何完成学习。

论文先在一个基于简化Pong构造的受控动态环境CITRIS Interventional Pong里做实验,以验证模型能否将复合变化“拆解学习、再行组合”。

在训练阶段,模型仅接收过单一因子的变化数据;测试阶段则需要面对此前从未出现过的多因子组合干预。

如果模型仅仅死板地记录了训练集中的完整模式,面对全新组合必然失效;如果模型学到的是不同变化之间可复用的状态变化规律,就更有机会在未见组合里重新组合它们。

实验结果表明,在分布内的单项干预中,JEPA-Anything相较标准JEPA降低了约11.7%的预测误差;而在未见过的多因子组合干预中,均方误差(MSE)同样下降了约3.5%,且在五组配对训练seed中全部改善。

随后,验证走向了更复杂的真实系统。

论文构建了一套严格对齐的动力学基准(Matched Dynamics Benchmark),在十项任务中确保标准JEPA与JEPA-Anything使用完全相同的训练数据、编码器、状态转移骨干网络、计算预算及评估切分。

在其中九项预测任务中,JEPA-Anything的性能指标均有所提升。

比如PDEBench里的Burgers方程,MSE下降39.7%;浅水方程下降39.3%;WeatherBench 2下降10.5%。

论文还专门做了多步rollout,让每一次预测继续成为下一次预测的输入,以观察误差不断传递之后会发生什么。

分子系统则把时间线拉得更长。

在液态水、α-石英、对乙酰氨基酚和苯四种体系中,模型需要持续预测未来的原子位置和速度,并把自己的输出不断喂回去。

最终,无论是一步预测的MAE,还是100步自由rollout后的最终位置RMSD,JEPA-Anything在四种分子系统中都拿到了最低误差。

不过值得注意的是,实验数据并未呈现出“单一机制全面碾压”的理想化曲线。

在连续控制测试中,JEPA-Anything并非每项任务都更好:在Walker2d和HalfCheetah上,它的平均得分高于标准JEPA;但在Hopper上,标准JEPA表现更好。

连续预测的距离越远,误差仍会不断累积。

在额外的Burgers测试中,当预测长度从20步增加到50步时,JEPA-Anything虽然仍然领先,但优势已明显缩小。

因此,这篇报告验证的是“共同预测原则存在跨领域适用性”,而非“已经实现一个统一所有领域的世界模型”。

但这些结果至少表明,这套预测原则具备跨领域复用的潜力。

JEPA-Anything学到的结构,能否经得起外部检验?

前面的实验主要回答预测和状态表示是否有效。到了第三组实验,论文继续追问一个更进一步的问题:

模型隐空间中所形成的因子(factor),究竟是否具备科学探索价值?

于是,就有了本文开头那两个画风迥异、却又遥相呼应的研究案例。

案例一:从内部因子走向可验证的候选干预

在肝癌研究中,研究人员并未将JEPA-Anything简单视作一个“黑盒预测器”,而是对其内部形成的正交因子坐标(Orthogonal Factor Coordinates)展开了领域分析,并从中筛出一个候选组合:IL-18联合NT5E/CD73阻断。

研究团队把它推进到Huh7-PBMC共培养体系,再到患者来源的肝细胞癌类器官和肿瘤组织碎片,之后还加入免疫健全小鼠验证。

实验数据表明,在3份患者类器官与3份肿瘤组织碎片中,IL-18与CD73阻断剂的组合均展现出最强的肿瘤细胞杀伤力,并伴随着显著增强的免疫细胞激活。

这意味着模型内部的Latent Factor不再只负责让预测数字“变好看”。

它开始成为研究者分析系统状态、提出可实验检验的候选假设的一种接口,由此形成“模型内部结构→领域分析→候选干预→实验验证”的链条。

案例二:从隐模式走向已知物理规律的“对账”

行星轨道案例反过来拿人类早已知道的开普勒第三定律,去检验模型内部学到的东西有没有物理意义。

研究者仅向模型输入模拟产生的行星位置与速度轨迹,未附带任何先验公式。

训练完成后,研究人员对模型的隐模式(Latent Modes)进行频谱分析,并将提取出的频率与轨道半长轴配对。

结果显示,即使没有人为提前设定公式,研究者还是从模型学到的latent modes中提取出了与这套变量关系高度一致的尺度规律——拟合得到斜率‑1.4991,和理论值‑1.5高度接近,误差极小。

一个案例从内部因子出发,走向湿实验;另一个把内部模式拿出来,与已有物理规律对账。

两者从不同方向为“模型学到的内部结构可以成为科学分析接口”提供了案例证据。

研究者不一定只能在终点看一个预测数字,还可以继续向里追问,它到底捕捉到了哪些变化?这些变化是否对应真实规律?能不能从中形成下一步值得验证的东西?

这也恰好是JEPA-Anything在PhAI Labs整体战略脉络中的定位。

此前,PhAI Labs提出“科学发现大模型”(Discovery Foundation Models, DFM),旨在推动AI向开放式的科学探索迈进。

在DFM设想中,AI需要进一步参与识别未知、形成假设、设计干预,并根据外部证据持续修正的科学发现过程。

JEPA-Anything位于这套结构的世界模型层。

它试图把科学trajectory和真实世界变化中可预测的部分,压缩成可以更快速调用的预测能力,在耗时更长、成本更高的真实实验之前,提供一层近似判断。

至此再审视“从癌细胞到行星轨道”的跨度,其意义便不再停留在展示视觉反差或概念噱头。

研究人员探索的是面对机制迥异的复杂系统,AI能否共享同一种学习“演化逻辑”的方法;以及当这些变化被编码进内部状态后,这些内部结构能否被研究者拿出来分析,并接受实验结果与已知规律的检验。

这距离“AI理解万物”当然还有相当距离。JEPA-Anything目前给出的更像是一种可能性:

世界模型内部学到的结构,除了服务预测,也可以被研究者继续分析,并接受实验和已知规律的检验。

换句话说,模型不只在预测一个世界,也开始把自己学到的“世界”暴露出来,供科学家继续研究。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10