機器人的數據生意:真需求,還是自循環?

藍鯨財經
2小時前

作者|霞光AI實驗室 子墨

梅卡曼德創始人邵天蘭的一則朋友圈,將具身智能行業心照不宣的隱祕爭議徹底擺上台面。

他言辭犀利地直指行業亂象:部分高估值具身智能企業,依託關聯交易、數據採集中心及地方資源包裝營收數據,以此衝刺IPO、謀求資本上市。此番發聲中,邵天蘭還在評論區直接點名銀河通用,引發行業熱議。

邵天蘭朋友圈截圖

針對此次質疑,銀河通用官方迅速作出回應,表態不願參與行業口水紛爭,將持續深耕技術研發、場景落地與商業化推進,專注自身核心業務發展。

一石激起千層浪。

一時間,針對"攢局型"具身智能企業左手倒右手、表演式數採的質疑聲四起——採集量級究竟能否支撐真實場景落地,衆說紛紜。

而早在今年8月,類似問題已被海外媒體所關注:《金融時報》在《誰在買中國機器人?》一文中,描述了一套交易鏈條:機器人企業與地方政府共建數採中心採購其機器人,隨後再把採集的數據賣回機器人企業,還將這一過程稱為「循環孖展」。

這也讓具身智能行業內的一些更本質問題,不得不被推到台前:機器人企業究竟需要什麼數據?數採中心生產的數據是否真正進入模型?設備訂單和數據交易又該如何判斷實際價值?

要看清這些問題,仍要回到一條數據產生、流轉並進入模型的全過程。霞光社對話了三位身處數採行業的從業者,分別從真實數據、訂單需求和觸覺數採出發,呈現出這門生意正在經歷的變化。

物理AI數據創業者 黃大榮:中國具身智能數採卡在哪?

如果只看機器人出貨量,中國具身智能似乎已經走得很快。但出貨量只能反映產業化進度,機器人能否在真實場景中完成任務,最終還要回到模型能力。而模型能夠走多遠,很大程度上取決於它究竟見過多少真實世界。

據了解,OpenAI 積累的原始數據已達到千萬小時級別,這還僅是保守估算。為其供給數據的海外機構,單月採集量便可達到百萬小時。反觀國內,簡智、光輪兩家企業同樣具備單月百萬小時的採集能力,但市場上願意大規模採購 Ego 數據的買家寥寥無幾。(Ego數據,指採集者頭戴相機 / AR 眼鏡,以人眼第一視角記錄人與物體交互的多模態數據,用來訓練人形機器人,讓機器人學習在真實環境裏怎麼觀察、抓取、完成任務。)

如此懸殊的差距,很容易讓人想到一條「捷徑」:真實採集既慢又貴,能不能直接依靠仿真和合成數據追上去?

可以是可以,但現階段恐怕很難。

自動駕駛已經走過一遍類似的路。最初,大量汽車先要在真實道路上運行,積累幾千萬甚至上億小時的數據。只有模型見過足夠多的道路、天氣和突發情況後,合成數據纔有參照,才能補充那些危險、低頻或難以重複的場景。現在的具身智能,更像自動駕駛的早期階段。真實物理世界的樣本底座還沒有建立起來,模型甚至沒有充分見過杯子如何滑落、人在狹窄空間裏如何調整動作。這個時候只談仿真,很容易生成一段「看起來合理」的視頻,卻無法讓機器人在現實中穩定完成任務。

既然真實數據採集那麼重要,為什麼國內的具身公司購買Ego數據量這麼少呢?

答案其實很簡單,就是因為錢不夠。雖然大家現在覺得具身孖展火熱、泡沫叢生,但實際上,要想真正落地真實場景,融到的這些錢還遠遠不夠。

我們可以來算一筆賬:一套採集設備可能要兩三千元,再加上採集人員,按照全球平均水平估算,僅人工成本就接近每小時15美元。把這個數字乘以一千萬,就能明白為什麼數據規模不是多建幾個數採中心、增加一些工位就能堆出來的。

並且數採也不是說量堆夠採夠了就行了,模型在早期需要的是廣度,要先「見過世界」。因此,採集需要覆蓋世界各地不同的國家和地區,讓機器人接觸不同的職業、家庭和生活環境。比如菲律賓的鐵皮房、柬埔寨的茅草屋,都是有價值的,它們能讓模型知道,人類並不都生活在標準化公寓裏。

菲律賓的鐵皮房

但廣度數據只能幫助模型完成前期預訓練。當機器人準備進入具體市場,採集就必須從「看得多」邁向「學得深」,圍繞目標場景反覆訓練。

例如,面向中國家庭的機器人,需要熟悉本地家庭的空間、物品和生活習慣;面向北美商超或咖啡廳,則必須到當地採集。店內員工可以簽署拍攝協議,但營業期間不斷進出的顧客很難逐一授權。因此,真正接近商業場景的數據,最難拿到,也最昂貴。

採集場景確定之後,還要保證採集的內容能夠真正被模型使用。攝像頭一直開着,只是增加採集時長,並不代表記錄下來的數據全部有效。

以印度的一些手工作業現場為例,當地人習慣赤腳圍坐在地上,邊聊天邊完成手裏的工作。雙手、雙腳和其他人的動作同時進入畫面,模型甚至需要先判斷哪個是手、哪個是腳。為了減少干擾,採集方案會要求操作人員分開工作,避免腳部入鏡,必要時還要穿上襪子。

但在實際執行中,有人不願分開,因為會影響彼此聊天;也有人認為只要戴着設備,就應該計算採集時間,即使中途喝水、休息或去洗手間,也不會主動關閉設備。

印度人做數採現場

同樣的流程交給國內數採員,溝通成本往往會低一些。講清楚場景表和操作規範後,他們通常能夠理解什麼是有效數據:只有完成規定動作時纔開啓設備,離開任務就暫停採集,無關人員也儘量不進入畫面。

兩種執行結果的差異,最終都會反映在數據質量上。

這也讓「採集了多少小時」成為一個容易失真的指標。設備運行一小時,不等於模型得到一小時有效數據。操作偏離流程、手部受到遮擋、多人動作相互交疊,都會產生大量的無效片段。而那些符合採集要求的片段,它仍然也只是生數據。要讓模型讀懂,還需要先剔除無效片段,再完成動作和語義標註。

例如,一段製作蛋花湯的第一視角視頻中,一個人左手端碗,右手拿着筷子,把蛋液打散,再倒進鍋裏。標註人員需要指出雙手的位置和姿態,並用語言說明每一步正在發生什麼:左手扶住什麼,右手如何運動,蛋液在什麼時機倒入鍋中,動作與物體之間產生了怎樣的關係。機器人學習的不是「這是一段做飯視頻」,而是畫面背後的動作邏輯。

數據完成清洗和標註後,才能正式進入模型訓練環節。

不過,現階段一些國內企業即使能拿到十萬小時數據,模型也未必能夠承受得住。問題不再是數據有沒有處理好,而是企業是否具備足夠的算力、穩定的數據管道和能夠持續訓練大模型的工程能力。數據需要被送入模型,訓練結果還要返回採集端,告訴團隊哪些動作已經足夠、哪些場景仍然缺失。這個循環跑不起來,採得再多也只是堆在服務器裏的素材。

OpenAI的優勢就在這裏。它不只擁有更多數據,還有足夠的算力和一整套能夠消化數據的治理能力。國內企業面對的則是多重缺口:數據量不足、算力受限,能夠同時理解模型和數據的團隊也不夠成熟。

這些問題歸根結底還是需要持續的資金投入來彌補。

雖然現在許多具身智能公司的估值很高,但估值並不等於真正到賬、可以用於訓練的錢。數據、算力和頂尖人才都是長期投入,而國內資金又分散在大量創業公司中,真正落到單家公司手裏的資金,很難支撐一場千萬小時級別的數據戰爭。

在這樣的資金壓力下,企業與地方共建數採中心,成為了補充設備和採集能力的一種方式,爭議也隨之出現:數採中心採購機器人形成銷售收入,採集的數據又被機器人企業買回,這些交易究竟來自真實訓練需求,還是主要在關聯主體之間循環?

設備數量、工位規模和採集時長容易展示,模型能力是否提升卻需要更長時間驗證。當後者難以被迅速證明時,設備訂單、項目規模乃至上市進度,就容易被當作企業成熟度的替代指標。

但在我看來,上市只是獲得繼續投入的機會,並不等於已經「上岸」。真正的上岸,是像酒店、餐飲或工業機器人,能夠進入真實場景,並被客戶重複採購,即使做的不是通用人形機器人,也已經建立了自己的商業閉環。

而機器人最終進入哪裏,又會反過來決定下一批數據應該採什麼。

從中國市場看,我判斷,家庭場景可能比工業場景更早出現機會。高端工廠已經完成了大量自動化,剩下的質檢等工作技術門檻很高;勞動密集型工廠的人工成本又很低,未必願意購買一台幾十萬元的機器人。相比之下,養老、做飯、洗衣、提醒用藥和取送物品,可能是更明確的需求。機器人不必一開始什麼都會,只要能夠在一個家庭裏穩定完成幾項重複工作,就可能產生購買或租賃價值。

所以,數採不能先把小時數做大,再去尋找用途。機器人準備進入什麼場景、服務什麼人、解決什麼問題,決定了哪些動作值得被記錄,哪些環境需要反覆訓練。

數據的終點從來不是服務器,而是機器人終於能夠在真實世界裏,把一件事做好。

中瞳數融總經理 孫浩:不是攝像頭開得不夠久,而是數據生產沒有真正接上模型需求

數採行業正在呈現一個看似矛盾的現象。

一邊,機器人企業不斷喊着「缺數據」,但真實數據的供應量可能連需求的1%都不到;另一邊,一些數採中心已經擺滿設備、招來數採員,採回來的數據卻遲遲找不到買家。

矛盾背後,其實是供需錯位:高質量數據供小於求,低質量數據供大於求。企業缺少的,是能夠解決模型問題的高質量數據;市場上開始過剩的,則是沒有明確用途、為了增加時長而生產的同質化數據。目前,數採行業最大的斷點,不是攝像頭開得不夠久,而是數據生產還沒有真正接上模型需求。

這種錯位,可以從一條有效數據是如何產生的說起。

桌上放着一個水杯,數採員伸手拿起它,看起來只有幾秒,為了讓機器人學會這個動作,卻可能需要重複幾十次。杯子的角度、抓取位置、手臂高度和使用的力量稍有變化,都會形成不同的運動軌跡。這些變化越豐富,機器人能夠學習的動作組合也就越多。

在此過程中,失敗的動作同樣可能有價值。如果第一次沒有拿穩,調整手勢後重新抓起,這條「失敗—糾正—恢復」的軌跡,有時比一次順利完成更有意義。因為機器人進入現實環境後,不僅要學會怎樣成功,還要知道出錯後如何繼續。

但有價值的失敗,不等於所有重複動作都有效。動作偏離要求、手部被遮擋或設備空轉,都會留下無法使用的片段。因此,數採員一天工作12個小時,最終能夠交付的有效數據可能只有2-5個小時。

這也意味着,模型企業提出的訓練需求,不能直接交給數採員執行,而要先被拆解成具體的動作、場景和交付標準。我們承擔的正是這項連接工作:公司一端對接頭部機器人企業和模型企業,明確訓練任務並承接數據訂單;另一端連接城投交投等地方國資平台,幫助其建設和運營數採中心,再把訂單轉化為能夠落地執行的採集任務。

當訓練需求明確後,數採團隊還要判斷,這批數據能否被不同企業和機器人複用。公共數據集、通用家庭動作和數字孿生資產適合標準化採集;故障恢復、複雜地形和特殊工藝,則要根據機器人的結構和傳感器進行定製。目前,我們承接的散單中,約六至七成都屬於定製需求。

訓練機器人熨衣服,受訪者供圖

無論是標準化還是定製化,採集方式解決的只是「數據怎麼生產」,至於數據有沒有價值,還要由模型訓練結果來回答。

模型企業通常不會一開始就採購大量數據,而是先圍繞具體場景和任務購買幾百或幾千小時。第一批數據進入模型後,訓練結果會返回數採端:哪些動作已經學會,哪些步驟仍然失敗,下一輪還需要補充什麼。數採團隊會據此調整任務,再把新的數據送回模型。採集-訓練-反饋-補採,由此形成一輪輪循環。

第一次購買可能只是試用,第二次、第三次購買,才說明數據確實解決了問題。

隨着同類數據不斷增加,模型能力的變化也會反映出數據的邊際效益。如果動作採了很多,模型表現卻不再明顯提升,這類數據就接近飽和,再繼續採集增長的只是文件數量,而非能力。

行業判斷數據價值的方式也因此在逐漸發生變化。過去,累計採集時長的數據本身就能成為項目亮點;而現在,比時長更重要的是模型任務成功率提高了多少、邊際效益是否還在增長,以及模型企業是否願意持續採購。只有訂單、訓練和復購形成閉環,數據的價值才能真正得到驗證。

但問題在於,目前能夠形成這種閉環的訂單還不夠多。

機器人尚未大規模進入工廠、倉庫和家庭,模型企業能夠提出的實際任務有限,數據訂單隻能隨着研發和落地進度逐步釋放。與此同時,各地卻已經看到了真實數據的長期價值,開始提前建設數採中心,希望為之後的產業需求準備產能。

長期需求確實存在,但它不會立刻變成足以支撐所有數採中心的訂單。於是,一些數採中心在等待訂單的過程中,只能先組織人員採集容易執行的動作。數據時長不斷增加,具體要解決哪個模型問題卻不夠清晰,「為了採而採」也就由此出現。

現階段,這種現象很難被徹底解決。一個新市場通常要經歷先發散、再聚攏的過程:參與者先進入,不同模式先被嘗試,隨後再由真實訂單、數據價格、模型效果和復購情況完成調整,最終形成相對穩定的行業格局。

在這個過程中,數採中心能否持續獲得訂單,一定程度上取決於能不能進入到有真實需求的場景中採集到數據。

然而,這些場景並不容易開放,比如家庭採集涉及隱私,精密製造工廠又包含生產流程和技術信息。為了解決這一問題,一些數採機構會與地方經信部門或國資企業展開合作,協調工廠開放部分流水線,再讓工人佩戴設備,或租用生產區域完成採集。

但能夠獲得這類訂單的數採中心仍然有限,其餘的數採中心只能採集門檻較低的通用動作,當這些數據無法賣給獨立採購方時,就只能被關聯的機器人企業購回,「循環孖展」的現象也由此產生。

地方與企業共建數採中心的模式本身沒什麼問題,但當企業從關聯的數採中心購買數據時,交易的真實性和獨立價值就需要進一步說明。比如訂單來自模型訓練、二次迭代還是其他需求,使用的具體場景、樣本類型及佔比,數據將用於完成哪些模型任務,以及交易價格是否公允,是否存在獨立第三方購買同類數據,復購量和復購率如何等等。

這些信息能夠幫助外界判斷,關聯交易是否建立在真實需求之上。同時,評價一家數採中心,也要看其有效數據比例、場景覆蓋度、模型能力提升、邊際效益和長尾問題解決情況,而不能只看設備數量、工位規模和累計時長。

沿着這套評價標準繼續發展,未來數採行業的分工也將更加清晰。

頭部機器人企業會保留內部數採部門,處理敏感數據、核心任務和安全要求較高的場景;公共數據、標準化任務和可複用場景,則交給第三方機構。

中小型數採企業不必與大廠比拼規模,而是在一些細分領域尋找機會。比如一些原本服務電力、能源、航空或礦山的企業,可以憑藉行業關係和信任基礎進入特殊作業現場;還有一些可以向數據清洗、標註、評測和數據資產平台延伸,不再只是出售採集時長。

數採中心本身也會逐漸變成混合系統:人工負責複雜動作和特殊情況,機器人自主完成簡單、重複的採集,評測系統篩選有效數據,再把結果反饋到採集端。數採員也可能會從動作執行者轉向評測工程師、任務設計師和長尾案例設計師等等。

數採員操作訓練,受訪者供圖

採集方式和崗位會發生變化,但真實數據在未來3-5年仍然不可替代。仿真雖然能夠快速生成低頻、危險或難以重複的場景,但重量、尺寸和摩擦係數等物理參數卻仍需從現實中獲得。參數一旦出現偏差,機器人在仿真環境中抓得再穩,進入現實也可能失敗。

因此,行業還要繼續積累大量真實數據和真機數據。等物體、場景和動作參數足夠豐富,仿真纔可能承擔更多預訓練和長尾場景生成任務。

從落地節奏看,工業場景可能會先於家庭釋放數據需求。前者已經存在相對明確的任務,數據訂單更容易圍繞實際問題產生;家庭機器人的空間雖然更大,技術能力和使用成本卻還需要時間成熟。

但無論機器人最終進入工廠還是家庭,數採的邏輯始終相同:場景提出問題,數據記錄解決問題的過程,模型再從這些記錄中學習。模型、場景和數據構成了具身智能的鐵三角。任何一環脫離另外兩環,都會陷入空轉。

因此,數採行業真正成熟的標誌,不是又建了多少中心、採了多少小時,而是能夠清楚回答一個問題:這批數據,究竟讓機器人學會了什麼。

超維傳感創始人兼CEO 李炎輝:觸覺數採仍是藍海,但第一步不是堆數據

當大量企業湧向視覺數採時,我們把注意力放在了觸覺。

一方面,團隊已經深耕觸覺傳感器12年,積累了長期的技術經驗;另一方面,視覺方向參與者衆多,沒有必要再重複「造輪子」。觸覺雖然存在霍爾、電容等不同路線,市面上從事相關手套的企業也有十餘家,但真正能夠穩定提供高質量觸覺信息的廠商仍然很少。從具身智能數採的角度看,這裏仍是一片藍海。

更重要的是,觸覺數採補上了視覺數採難以覆蓋的接觸信息。機器人可以通過視覺找到目標,但手指接觸物體後,還要根據壓力、摩擦和受力變化,判斷有沒有拿穩、應該使用多大的力。

以拿起一個300克的水瓶為例:假設拿起水瓶恰好需要5N的力。如果不同傳感器在相同動作中分別記錄出4N、5N和6N,模型就可能誤以為,4-6N都能完成抓取。但到了現實中,4N可能拿不起來,6N又可能把瓶子捏癟,讓水灑出來。

模型不會主動判斷哪一個數值錯了,它只會按照收到的數據學習。因此,觸覺數採首先要解決的是:同樣的接觸,能否被不同設備穩定地記錄為一致的結果。

這也決定了觸覺數據不能一開始就用採集時長衡量。只有先解決一致性問題、建立統一的數據標準,討論時長才有意義。

如果同一個動作在不同手套、不同批次的傳感器上得到不同結果,一小時的數據可能存在偏差,一萬小時只會積累更多偏差。反過來,如果傳感器能夠持續、穩定地記錄接觸信息,採集時間越長,模型獲得的有效樣本纔可能越多。

因此,觸覺數據的「有效」,意味着記錄準確、結果一致。要做到這一點,不能只依靠某一個零部件。從底層材料、印刷工藝到軟件算法、貼合和標定,任何環節出現偏差,都可能讓最終力值發生變化,本質上是要給觸覺數採建立一把統一的尺子。

有了這把尺子,觸覺數據的有效時長反而比視覺數據更容易判斷。

視覺設備連續工作8小時,可能拍下大量與任務無關的畫面,真正能夠進入訓練的數據不到一半。觸覺傳感器則不同:沒有發生接觸時,記錄值為零;只要真實接觸發生,設備保持一致、操作符合規範,這段觸覺信息就可以被留下。如果8小時都在按照標準完成有效接觸,8小時就可以是8小時有效數據。

但數據有效,並不意味着數據足夠豐富。

比如讓數採員反覆疊一條毛巾,若毛巾的材質、擺放方式和操作過程完全相同,即使重複100次、1000次,採回來的數據雖然符合標準,但模型學到的內容卻十分單一。

真正有價值的數採,需要在統一標準下製造更多變化。毛巾的材質可以不同,光線可以從明到暗,也可以產生陰影;操作姿態和摺疊方式也可以調整。模型見過的變化越多,進入真實場景後才越有可能完成任務。

但這些變化也不能脫離採集目標,如果正常任務要求五根手指抓住水瓶,操作過程中卻只用指腹或手掌發生了非正常接觸,傳感器即使準確記錄了力值,數據也可能偏離原本的任務要求。

因此,觸覺數採不僅需要執行動作的人,也需要能夠設計動作的人。

短期內,數採員的需求會快速增加,但崗位也會逐漸分化。一類人按照制定好的規範完成重複操作;另一類人則要理解模型需要什麼,設計材質、姿態和接觸方式等變量,讓普通操作人員也能穩定採出高質量數據。長期來看,前者可能會先增加再減少,後者會持續存在。

人員之外,觸覺數採能否擴大規模,還要看採集設備如何完成驗證,並進入實際項目。

我們並不直接經營數採中心,而是為模型企業和數採機構提供高一致性的數採手套,並與使用方共同研究採集規範。目前,一副觸覺數採手套市場價格大約為幾千元,但採購通常不會一步到位。

超微傳感 超芯維Hypetrix HSG系列數採手套,目前已在京東店鋪上線,受訪者供圖

剛開始時,模型企業或數採機構可能會先採購10-20套,用來驗證可行性和設備性能;驗證通過後,纔可能擴大至上千套。設備能否擴大部署,也不只取決於硬件本身,還取決於採回來的數據是否真正幫助模型完成了任務。模型反饋回來之後,採集方式和傳感器還要繼續調整。

隨着觸覺數據需求不斷擴大,成本更低的仿真和合成數據也會逐漸進入模型訓練。但現階段,它們還無法替代真實數據,因為觸覺領域尚未形成足夠規模的數據基礎。

就像生成式視頻能夠合成畫面,是因為模型已經學習過海量真實視頻。觸覺同樣如此:壓力、摩擦以及不同材料接觸時的反饋,都要先從現實世界中獲得,仿真和合成數據纔有學習與校準的依據。

因此,早期的真實觸覺數據會遠多於合成數據。積累到某個階段後,合成數據可能逐漸增加,甚至超過真實數據。這個拐點何時到來還無法確定,但真實數據必須先完成基礎積累。

真實數據的持續積累,最終需要由具體應用場景承接。相較於家庭,工業領域更可能會率先形成穩定的觸覺數據需求。

工廠環境相對結構化,機器人要抓什麼、放到哪裏、使用多大的力,都更容易被定義,數採任務也能圍繞具體操作展開。這個方向雖然競爭激烈,但也恰恰說明越來越多企業看好它進入實際生產的速度。參與者增加,也會帶來更多嘗試和成功案例,推動中國製造業提高生產效率。

當然,並不是所有進入這個賽道的企業都能留下。產品是否穩定、數據是否有效、模型能否因此完成實際任務,最終都要接受現場的檢驗。沒有價值的產品和數據會被淘汰,真正解決問題的企業才能在競爭中生存。

數採中心也會經歷類似的篩選,經歷一個從少到多、再從多到少的過程。

產業早期需要快速積累數據,數採中心會先從少到多。但當簡單、重複的數據逐漸採夠,只承擔標準動作採集的中心會慢慢減少。能夠進入特殊場景、提供高質量數據和定製服務的機構,纔可能長期存在。

與此同時,行業分工也會隨之形成。涉及精密製造、核心工藝和企業獨有技術的數據,很難對外開放,頭部企業可能會建立數採部門,將這些數據留在內部,形成自己的「護城河」。更通用、更寬泛的數據,則可以由第三方機構提供,幫助模型企業降低採集成本。

如今,具身數採仍處於早期階段,難免魚龍混雜,充滿爭議,但最終都會聚焦到價值,迴歸到實質。那些能夠持續提升數據質量、推動統一標準建立的參與者,更有可能在行業沉澱之後留下來。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10