上海机器人独角兽开源世界模型,能“看懂”三维物理世界了

智东西
Sep 10

机器人前瞻(公众号:robot_pro)

作者 | 周加琦

编辑 | 漠影

机器人前瞻9月10日报道,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型Puffin-World

Puffin‑World在一个统一多模态模型中,将物理、几何、外观视作三类原生三维世界状态。为实现三维世界的精准构建和稳定交互,该模型打通重力场感知、自由视点空间仿真、三维世界生成与重建,以及闭环探索,可根据机器人的动作,预判场景的后续状态变化。

为支撑模型训练,该团队还构建了Puffin-16M数据集,包含1500万组视觉-语言-相机三元组、100万条旋转轨迹样本。

在性能评测上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir、LaMAR四项公开基准评测中均取得SOTA。其中在Stanford2D3D上,横滚角、俯仰角、垂直视场角中位误差低至0.29°、0.53°、1.62°,相机物理姿态预测精度领先其他方案。

项目链接:https://kangliao929.github.io/projects/puffin-world/

代码链接:https://github.com/KangLiao929/Puffin

Arxiv链接:https://arxiv.org/abs/2609.04196

Hugging Face链接:https://huggingface.co/blog/KangLiao/puffin-world

一、从三层世界状态出发,Puffin-World统一物理、几何与外观

目前,多数生成式世界模型只会预测未来的RGB图像或视频内容。但真实的物理世界并不只有视觉画面,而是由物理、几何、外观三层状态共同构成。

想要实现图像稳定生成、空间一致仿真、可交互的真实三维场景,就必须同时融合这三层信息。

因此,Puffin-World从三维世界状态本身出发,结合三种状态共同构成“世界如何存在”到“世界如何被交互”的完整表达。

其中,物理状态负责判断视角在真实世界的绝对位置与朝向,包含重力场、纬度图;几何状态通过深度信息还原场景的三维结构、空间远近与表面关系;外观状态则对应最终呈现的RGB视觉画面。

另外,Puffin-World还提出了全向相机(Omni-Camera)表征,将绝对与相对两类相机表征合二为一。这样一来,Omni-Camera既保留了绝对表征识别重力、对齐真实世界的物理锚定能力,又具备相对表征流畅推演连续镜头运动、多视角变换的优势。

这套统一表征可以同时支撑物理场景理解、任意视角可控生成、连续三维场景建模。

最终,三种世界状态回答了“世界如何存在”,全向相机表征则打通了“世界如何被观察与交互”,共同构成Puffin-World从感知到生成、从单一视角到完整场景的闭环能力。

二、覆盖四大能力,可感知、生成并探索三维世界

Puffin-World依托单一多模态模型,能够同时实现物理世界感知、自由视角空间仿真、三维世界生成与重建、闭环自校准探索的能力。

不同于传统方案为不同任务单独搭建子网络,该模型通过三层统一设计,让一个模型就能兼容全部视觉与三维场景任务,通用性更强。

Puffin-World的核心能力主要包含四个部分。

单图理解物理信息。只用输入单张图像,Puffin-World就能够推算出相机的绝对物理状态,包含重力朝向、横滚俯仰角度、视场大小等真实世界物理参数。

自由视点空间仿真。该模型支持任意可控相机视角生成,可根据自定义镜头位置、角度与运动方式,智能推演镜头移动后的全新视角,实现真实、稳定、符合物理规则的自由视角场景仿真。

三维世界生成与重建。Puffin-World能够根据文字、单视角或多视角图像,完成场景外观生成和三维几何重建,精准还原场景的深度、空间结构、物体位置等,构建更加完整的三维场景。

闭环自校准探索。该模型可复刻指定相机轨迹生成完整场景,并能预判镜头运动、推演未来画面,自动修正视角与重力偏差,实现自适应的持续探索,更接近真实机器人交互。

三、1600万组数据加持,补齐真实世界绝对相机位姿

目前多模态领域,能同时精准匹配画面内容、场景语义、真实物理规则的高质量数据集非常稀少。为此,该团队构建了Puffin-16M数据集,包含1500万组视觉-语言-相机三元组,以及100万条复杂、高难度相机运动的轨迹样本,分别命名为Puffin-Cam-15M与Puffin-Traj-1M。

其中Puffin-Cam-15M将原始全景场景素材从20万张扩充至90万张,覆盖室内外、合成场景、真实环境,以及多国自动驾驶街景。Puffin-Traj-1M则覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况。

另外,现有公开数据集,只能记录镜头之间相对的位置变化,无法对应真实世界的重力、绝对朝向,导致模型学不到真实物理规律。因此,该团队还利用Puffin-World为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图片。

四、四项Benchmark拿下SOTA,复杂场景下仍保持高精度

根据评测结果显示,在Stanford2D3D、MegaDepth、TartanAir、LaMAR四个公开数据集上开展评测。Puffin-World在室内实景、户外街景、仿真合成、大规模真实图像各类场景下,横滚角、俯仰角、视场角三项相机参数的预测误差均取得最优结果。

在Stanford2D3D中,该模型的横滚角、俯仰角、垂直视场角中位误差分别为0.29°、0.53°、1.62°,展现极强的绝对相机物理理解能力,能够精准识别重力与世界坐标系。MegaDepth评测下,横滚角、俯仰角、视场角中位误差达到0.28°、1.01°、2.41°。面对真实复杂的城市户外环境,Puffin-World依旧保持很高的预测精度。

在TartanAir中,Puffin-World三项参数中位误差为0.31°、0.67°、2.34°,在合成场景下也可以稳定完成相机物理参数的推算。另外在LaMAR评测下,横滚角、俯仰角、视场角中位误差为0.26°、0.71°、2.73°。面对海量风格的真实图像,该模型依旧保持领先的预测水平。

结语:世界模型从“预测画面”走向“理解世界”

过去的生成式世界模型更多聚焦于预测下一帧图像或视频,而Puffin-World进一步将物理、几何、外观以及相机运动统一到同一模型中。

这也意味着,世界模型正在从对视觉内容的预测,进一步走向对真实世界状态的建模与推演。对于机器人而言,这种能力让机器能够在行动之前理解所处环境、预测动作可能带来的变化,进一步支撑其在真实三维世界中的自主感知、决策与交互。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10