作者|深眸財經 鄭施婧
當下,AI行業最常被提及的焦慮,非算力短缺莫屬。英偉達GPU一卡難求的新聞屢見不鮮,價格也隨之高漲。以H100為例,市場價一度被炒至4萬美元以上,是其官方定價兩倍以上,同時交貨周期拉長至數月。這種供需錯配推高了AI企業的訓練成本,也讓市場瀰漫着焦慮的情緒。
然而,當我們把視線從大模型移至具身智能,就會發現,算力荒在這裏更像「成長的煩惱」。更令從業者夜不能寐的,是另一個早已降臨的深層瓶頸「數據荒」。
據行業測算,要訓練出具備通用泛化能力的具身模型,需要千萬,甚至億小時級別的真實操作數據;而截至2026年初,全球可用的高質量物理交互數據總量僅約50萬小時,缺口超過99%。這意味着,具身智能當前的數據基礎,距離真正意義上的通用泛化能力還差兩個數量級以上的距離。這不是漸進式的差距,而是根本性的斷檔。
具身智能已經撞上了一堵比算力短缺更難翻越的「數據荒漠」。
01「算力荒」是工程問題「數據荒」是維度災難
過去,摩爾定律讓單芯片晶體管數量每18個月就能翻一番。算力成本持續下降,英偉達H100的FP8算力接近2petaFLOPS,相較五年前的V100,單位算力成本大幅下降;台積電CoWoS封裝產能也在有序擴產,月產能從2023年的約1.4萬片晶圓,在2025年提升至約7萬片,預計2026年底增加到13萬片。
如此來看,算力瓶頸是產能問題,有明確的擴產周期。但具身智能面對的是物理世界的無限複雜性,這更像是一場維度災難。
首先就是數據無法被「爬取」。大語言模型可以吞噬互聯網上人類千年積累的文本資料,例如GPT-3就有約45TB數據。但機器人要理解物理世界,卻沒有現成的「教科書」。
單論「擰瓶蓋」這個人類憑直覺完成的日常動作,背後是物理世界的無數隱藏變量,機器人需要理解瓶蓋的材質、螺紋摩擦力等多變量。而這些變量恰恰是互聯網這個「大模型糧倉」從未儲存過的。
所以當大模型用「文字」丈量世界時,具身智能需要用「動作」來感知物理現實。這種性質上的差異,讓數據荒漠遠比算力競賽更為棘手。
另外,具身智能對數據「質量」的要求也遠比大模型嚴苛。在大模型訓練中,錯別字或語法瑕疵尚能處理。比如說,GPT-3的訓練數據裏可能混入了像「偶今天真滴好開森」這種口語化、帶錯詞甚至缺標點的句子,但大模型依然可以從大量規範文本中提煉出主謂賓的規律,學會正常的表達方式。
而具身智能的數據規律就遠不如文字清晰,噪聲的類型、嚴重程度、對模型的影響都難以定義。例如,採集時攝像頭幀率抖動、關節編碼器延遲、力控傳感器漂移等,這些噪聲不像文本錯別字那樣可以檢索替換。
鹿明機器人聯席CTO丁琰就曾指出,市面上大量UMI數據採集設備因硬件能力不足,畫面與動作無法嚴格對齊,導致產出的數據根本「不具備進入訓練管線的條件」。這意味着,具身智能的數據採集從一開始就面臨「質量門檻」,低質數據不僅無法助力訓練,反而會污染模型。後者是「費力」,前者則可能是「無用」。
除此之外,具身智能的數據還無法像算力一樣遷移複用。例如,英偉達的GPU架構從A100到H100,能針對不同任務的計算效率持續提升,模型訓練可以無縫升級。但具身智能具有極強的硬件依賴性,一台1.6米高的機器人與1.8米高的機器人,在執行同樣的「彎腰撿拾」動作時,關節角度、重心偏移、抓握角度等可能完全不同。所以前者採集的數據,對後者而言可能無效。這也導致具身智能數據之間有天然的隔離,形成了一個個獨立的「數據孤島」。
如此來看,算力是可複用的標準化資源,隨着工藝進步和產能擴張,其成本與獲取難度必然趨近於下降;而數據卻是與特定硬件、特定場景深度綁定的「非標品」,每一款機器人、每一次部署都可能需要重新積累。從本質差異上來看,算力荒是暫時的、可解的,而數據荒是長期的、結構性的核心瓶頸。
02真機、UMI、仿真三路並進數據採集路線尚在突圍
面對「數據荒」的困境,目前業界主要探索出三條技術路線,即真機遙操作、無本體UMI採集、仿真合成數據。它們分別代表了精度、規模與成本的權衡,但尚未有一條能完美兼顧三者。
先來看真機遙操作。這是最早的方案,通過VR設備、動捕服等遙操作真實機器人,逐條記錄動作數據。優點是數據真實度高、可直接用於同款機器人訓練。例如,宇樹科技的基於輪式人形機器人G1-D的數採訓練全棧解決方案,其採集數據可直接用於同款G1-D機器人的模型訓練。
但代價同樣驚人。北京人形機器人創新中心投資建設了近5000平方米的數採場地,投入了120台機器人用於數據採集,僅場地和設備投入就達數千萬元。智元機器人建有大規模數採中心,部署約200台機器人,數百名數據採集員的輪班運營。場地、設備折舊加上人力薪酬,構成了長期且高昂的固定支出。
(圖源:智元機器人)
目前來看,真機遙操作好比手工精雕,精度雖高,但速度慢、花費大。這種模式或許更適合在高附加值場景,如醫療手術、特種作業中擔任主力數據源。如果要靠它撐起億級數據的底座,以目前機器人廠商的資金儲備來看,或許難以承擔。
UMI方案則將採集設備與機器人本體解耦,用人手持輕量化的夾爪和攝像頭,在真實場景中操作採集。大衍科技就曾通過與無人超市、前置倉合作,讓工作人員佩戴採集設備正常上班,在日常生活中就把數據採集了。如此,UMI更像用上了半自動工具,雖然仍需人力,但採集速度快了不少,花費也大幅下降。
然而,上海交大盧策吾團隊卻指出,具身模型規模化卡在數據採集的「真實性與質量平衡」難題。具體而言,UMI採用手持設備,難以保證每次採集時攝像頭角度、夾爪姿態的一致性,導致數據格式不統一;大規模採集後,海量低質量數據需要大量人工後處理進行篩選和對齊,反而可能使綜合成本不降反升。如此來看,UMI雖然降低了採集門檻,卻把數據質量的「雷」埋在了更隱蔽處。
而仿真合成這條路則徹底拋棄真機,直接在仿真引擎中生成海量訓練數據。例如,跨維智能開源的工具鏈EmbodiChain,100%使用合成數據訓練VLA模型,且能直接部署於真實機器人,實現了虛實遷移;諾基亞聯合英偉達,基於Isaac仿真平台構建「AI數據飛輪」,將智能體訓練速度提升近10倍。
但問題在於仿真畢竟是「仿」的。仿真環境再精細,也無法完全復現現實生活。斯坦福大學《2026 AI Index Report》顯示,仿真環境下任務完成率可達89.4%,但在真實家庭場景中驟降至約12.4%。這揭示了一個殘酷的現實,仿真訓練出的模型在實驗室裏是「優等生」,可一旦踏入真實世界的「考場」,成績便大打折扣。虛實鴻溝仍是仿真路線上繞不開的硬門檻。
(圖源:斯坦福大學《2026 AI Index Report》)
三條路線各有優劣,短期內將在不同場景中並行探索,真機遙操作守住精度上限,UMI主攻規模化採集,仿真合成負責覆蓋極端場景。長期看,UMI兼顧真實性與可低成本擴充規模,或許是突破數據荒的主力。
03陷入「囚徒困境」的數據採集與不明朗的行業最優解
無論哪條路線,似乎都卡在同一個死結上,數據無法同時滿足「規模、質量、成本」三角。每家公司都在投入,卻都走不遠。面對如此困境,從全行業理性角度出發,或許最優解是將數據開源,即共享數據、攤薄成本、避免重複採集。
市場上已經有了先行者。樂聚牽頭聯合宇樹、阿里雲等共建國內首個國家級具身智能開源數據社區OpenLET,已開源超6萬分鍾真機數據集,供業界使用;均普智能於2026年6月開源了面向真實機器人強化學習的大規模數據集RW-RL-Dataset。這些嘗試為行業提供了寶貴參照,也在證明數據共享在技術層面並非不可行。
然而,開源仍是少數派的理想主義,更多企業選擇了商業變現之路。京東將數據採集作為獨立生意,計劃發動最多60萬人參與,兩年內積累1000萬小時視頻數據,並已上線具身智能數據交易平台,首批定向開放2000小時高精標註「數據集」;箸境智能在江蘇省數據交易所完成全國首筆具身智能數據集交易,包含約2.5萬條結構化數據,覆蓋辦公、商超、餐飲、家政四大場景;鹿明機器人則打造了「數據超市」,供客戶在線採購標準化操作數據。星海圖CEO高繼揚就曾明確指出,當前行業對於數據具有強烈的「私有化屬性」。由此看來,數據在當下更被視為企業的核心資產和可交易的商品,而非開源的公共資源。
(圖源:LUMOS鹿明)
數據共享雖然能讓全行業受益,但商業邏輯下,誰先開源,誰就可能被對手低成本複製成果。於是這家不願為別人作嫁衣,那家擔心對手反超。個體都保護自身利益,最終導致全行業重複採集、效率低下。這正是經典的「囚徒困境」。共享是烏托邦式的理想,現實卻正滑向「各自為戰」。目前來看,除非出現強有力的行業標準與利益分配機制,否則行業「最優解」可能將長期停留在願景中。
04從「數據餵養」到「自我迭代」數據「奇點」何時到來?
如果行業註定要各自突圍,那最有可能的方向是什麼?或許我們可以從大模型的進化中尋找啓示,比如讓機器從「被投餵」走向「自主覓食」。
大模型的發展已驗證這條路徑。英偉達研究團隊開發的Eureka系統,讓AI能生成多個解決方案並自我篩選,像程序員一樣進行「自我批評」和改進。Eureka在83%的任務中超越人類專家,使機器人性能平均提升52%;Kimi K2則通過構建工具模擬器讓智能體在「沙盒」中練習,在與模擬環境的持續交互中積累經驗並自我迭代。
這兩個案例的共同邏輯是,智能體不再被動等待人類投餵數據,而是通過與環境互動自主生成訓練信號。或許可以借鑑這一邏輯,通過某種機制實現具身智能的自我迭代。
具身智能的「數據奇點」,可能不在於數據量的堆砌,而在於形成一個「採集→訓練→落地→再採集」的閉環。
上海創智學院與智元具身研究中心聯合提出的LWD系統,正是這一理念的實踐。它讓機器人在真實任務中持續積累交互經驗,包括成功軌跡、試錯後的自我恢復,以及人為引導的失敗案例,全部回傳,持續微調優化模型。通過這一機制,LWD訓練的單一通用策略在長程複雜任務中的平均成功率達到0.95,遠超傳統行為克隆的0.76和離線強化學習基線的0.86。
這一結果表明,閉環迭代並非紙上談兵,而是已被驗證的有效路徑。循此思路,可以設想一個場景:機器人學會「扭瓶蓋」後,應用時遇到一個滑絲瓶蓋,經微調扭矩後成功擰開。這個「意外經驗」被記錄下來並回傳,模型更新後再部署給所有機器人。此後,所有機器人都學會了處理滑絲瓶蓋。擴展後,每個機器人遇到的特殊狀況,都可以變成整個機器人群的共同經驗。當跑通這個閉環,或許機器人將不再依賴人類的持續投餵,而是在真實世界的場景中自主進化。
總而言之,對於具身智能來說,算力可以購買,但物理世界的經驗必須親身積累。誰能率先讓機器人在真實世界中跑通「自我迭代」的飛輪,誰就將更可能定義下一階段的行業格局。這場漫長的馬拉松,或許比的不是誰擁有更多GPU,而是誰能讓機器人更好地「理解」這個物理世界。