
機器人前瞻(公衆號:robot_pro)
作者 | 周加琦
編輯 | 漠影
機器人前瞻9月10日報道,近日,大曉機器人聯合南洋理工大學S-Lab等機構發布並開源統一多模態世界模型Puffin-World。

Puffin‑World在一個統一多模態模型中,將物理、幾何、外觀視作三類原生三維世界狀態。為實現三維世界的精準構建和穩定交互,該模型打通重力場感知、自由視點空間仿真、三維世界生成與重建,以及閉環探索,可根據機器人的動作,預判場景的後續狀態變化。
為支撐模型訓練,該團隊還構建了Puffin-16M數據集,包含1500萬組視覺-語言-相機三元組、100萬條旋轉軌跡樣本。
在性能評測上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir、LaMAR四項公開基準評測中均取得SOTA。其中在Stanford2D3D上,橫滾角、俯仰角、垂直視場角中位誤差低至0.29°、0.53°、1.62°,相機物理姿態預測精度領先其他方案。
項目鏈接:https://kangliao929.github.io/projects/puffin-world/
代碼鏈接:https://github.com/KangLiao929/Puffin
Arxiv鏈接:https://arxiv.org/abs/2609.04196
Hugging Face鏈接:https://huggingface.co/blog/KangLiao/puffin-world
一、從三層世界狀態出發,Puffin-World統一物理、幾何與外觀
目前,多數生成式世界模型只會預測未來的RGB圖像或視頻內容。但真實的物理世界並不只有視覺畫面,而是由物理、幾何、外觀三層狀態共同構成。
想要實現圖像穩定生成、空間一致仿真、可交互的真實三維場景,就必須同時融合這三層信息。
因此,Puffin-World從三維世界狀態本身出發,結合三種狀態共同構成「世界如何存在」到「世界如何被交互」的完整表達。
其中,物理狀態負責判斷視角在真實世界的絕對位置與朝向,包含重力場、緯度圖;幾何狀態通過深度信息還原場景的三維結構、空間遠近與表面關係;外觀狀態則對應最終呈現的RGB視覺畫面。
另外,Puffin-World還提出了全向相機(Omni-Camera)表徵,將絕對與相對兩類相機表徵合二為一。這樣一來,Omni-Camera既保留了絕對錶徵識別重力、對齊真實世界的物理錨定能力,又具備相對錶徵流暢推演連續鏡頭運動、多視角變換的優勢。
這套統一表徵可以同時支撐物理場景理解、任意視角可控生成、連續三維場景建模。
最終,三種世界狀態回答了「世界如何存在」,全向相機表徵則打通了「世界如何被觀察與交互」,共同構成Puffin-World從感知到生成、從單一視角到完整場景的閉環能力。
二、覆蓋四大能力,可感知、生成並探索三維世界
Puffin-World依託單一多模態模型,能夠同時實現物理世界感知、自由視角空間仿真、三維世界生成與重建、閉環自校準探索的能力。
不同於傳統方案為不同任務單獨搭建子網絡,該模型通過三層統一設計,讓一個模型就能兼容全部視覺與三維場景任務,通用性更強。
Puffin-World的核心能力主要包含四個部分。

單圖理解物理信息。只用輸入單張圖像,Puffin-World就能夠推算出相機的絕對物理狀態,包含重力朝向、橫滾俯仰角度、視場大小等真實世界物理參數。
自由視點空間仿真。該模型支持任意可控相機視角生成,可根據自定義鏡頭位置、角度與運動方式,智能推演鏡頭移動後的全新視角,實現真實、穩定、符合物理規則的自由視角場景仿真。
三維世界生成與重建。Puffin-World能夠根據文字、單視角或多視角圖像,完成場景外觀生成和三維幾何重建,精準還原場景的深度、空間結構、物體位置等,構建更加完整的三維場景。
閉環自校準探索。該模型可復刻指定相機軌跡生成完整場景,並能預判鏡頭運動、推演未來畫面,自動修正視角與重力偏差,實現自適應的持續探索,更接近真實機器人交互。
三、1600萬組數據加持,補齊真實世界絕對相機位姿
目前多模態領域,能同時精準匹配畫面內容、場景語義、真實物理規則的高質量數據集非常稀少。為此,該團隊構建了Puffin-16M數據集,包含1500萬組視覺-語言-相機三元組,以及100萬條複雜、高難度相機運動的軌跡樣本,分別命名為Puffin-Cam-15M與Puffin-Traj-1M。

其中Puffin-Cam-15M將原始全景場景素材從20萬張擴充至90萬張,覆蓋室內外、合成場景、真實環境,以及多國自動駕駛街景。Puffin-Traj-1M則覆蓋連續俯仰、橫滾、偏航、複合運動以及360度環視等複雜情況。
另外,現有公開數據集,只能記錄鏡頭之間相對的位置變化,無法對應真實世界的重力、絕對朝向,導致模型學不到真實物理規律。因此,該團隊還利用Puffin-World為28個公開數據集補充絕對相機位姿標註,覆蓋約4450萬張圖片。
四、四項Benchmark拿下SOTA,複雜場景下仍保持高精度
根據評測結果顯示,在Stanford2D3D、MegaDepth、TartanAir、LaMAR四個公開數據集上開展評測。Puffin-World在室內實景、戶外街景、仿真合成、大規模真實圖像各類場景下,橫滾角、俯仰角、視場角三項相機參數的預測誤差均取得最優結果。

在Stanford2D3D中,該模型的橫滾角、俯仰角、垂直視場角中位誤差分別為0.29°、0.53°、1.62°,展現極強的絕對相機物理理解能力,能夠精準識別重力與世界座標系。MegaDepth評測下,橫滾角、俯仰角、視場角中位誤差達到0.28°、1.01°、2.41°。面對真實複雜的城市戶外環境,Puffin-World依舊保持很高的預測精度。
在TartanAir中,Puffin-World三項參數中位誤差為0.31°、0.67°、2.34°,在合成場景下也可以穩定完成相機物理參數的推算。另外在LaMAR評測下,橫滾角、俯仰角、視場角中位誤差為0.26°、0.71°、2.73°。面對海量風格的真實圖像,該模型依舊保持領先的預測水平。
結語:世界模型從「預測畫面」走向「理解世界」
過去的生成式世界模型更多聚焦於預測下一幀圖像或視頻,而Puffin-World進一步將物理、幾何、外觀以及相機運動統一到同一模型中。
這也意味着,世界模型正在從對視覺內容的預測,進一步走向對真實世界狀態的建模與推演。對於機器人而言,這種能力讓機器能夠在行動之前理解所處環境、預測動作可能帶來的變化,進一步支撐其在真實三維世界中的自主感知、決策與交互。