合十思維創始人趙普:重塑機器人大腦,NEXUS AI 類腦架構如何打通虛擬與真實物理世界

市場資訊
08/20

專題:2026世界機器人博覽會(WRC)AI大模型賦能機器人與具身智能產業新範式交流活動

  2026世界機器人博覽會(WRC)於8月19-23日在北京亦創國際會展中心舉行。「AI大模型賦能機器人與具身智能產業新範式專題活動」在博覽會同期舉辦。合十思維創始人趙普出席並演講。

  以下為演講實錄:

  趙普:感謝主辦方,我今天給大家帶來的演講題目叫重塑-類腦架構如何打通虛擬和真實物理世界。

  我們先看一封信吧,這是1993年,33年前,錢學森老先生為戴汝為同志寫的一封信,這裏頭有一個觀點,就是說智能機器人可以幹一些複雜的事,他對AI端到端進化論有侷限性的前瞻判斷。這本書是戴汝為同志著的,叫《社會智能科學》,收錄在了第221-222頁,這本書其實對我們具身智能包括機器人整個的研發是有幫助的,大家可以回頭看一下。

  我們機器人是如何觀察世界的呢?其實就是與感知、空間認知、VLM、VLA,還有預測決策,就是我們的世界模型,然後再加上強化學習。機器人的觀察它不是被動的,而是感知理解、預測行動的一套全鏈路體系,但是它並沒有說以機器人自我為核心,對世界做一個認知。

  這個就是我們講的大規模數據訓練底層的必然性,比如說場景組合的複雜性、長尾性、多模態。然後人類認知的物理世界有很多隱性的物理世界的規律,包括它泛化的一些規模效應,都其實很難達成,我剛纔講了,我們這些訓練方式裏面有很多泛化性的難題,包括很多長尾性的問題都沒有辦法去解決。

  這是Figure AI的創始人佈雷特·阿德科克對中國機器人的一些看法,我們可以先聽一下,這是時隔33年以後,對於我們中國機器人的一些看法。

  (播放視頻)

  其實啱啱Figure AI的創始人提到一句話,叫作我們想攻克人類級的智能。其實我們現在大規模對世界模型包括強化學習的訓練,其實想體現一個什麼呢?就是機器人真正走入家庭以後怎麼去完成人類的智能,其實說的就是人類智能的適應性。

  那麼人類是如何觀察世界的?它裏面有一個東西叫可共性,實際上在做訓練的時候,我無數次的舉過一個例子,比如在一個封閉的家庭環境裏面,我現在要抽菸,然後沒有菸灰缸,我可能會用一個紙杯,但紙杯這個東西如果彈菸灰的話,這個數據就塌縮了,雖然外形是紙杯,功能已經成了菸灰缸,當我們在訓練大模型的時候,可能用很多圖像的東西去給它做訓練,就是你用豆包、DeepSeek,包括基於Open AI的很多視覺模型去看它,它還是一個紙杯,但是人不會再拿它去喝水了。所以說其實人類認知不是通過像素點,也不是通過具體事物的外形,而是它的功能性,其實就是可共性。

  人類認知高效形成的底層邏輯,其實就是功能抽象和消解組合爆炸以及因果推理去解決這個決策的難題,就像我啱啱說的,同樣的例子,我們在拆快遞的時候,如果你沒有美工刀,你會拿起圓珠筆、尺子,還有指甲刀去拆它,為什麼?因為堅硬的東西可以劃開柔軟的物品,機器人如果你只訓練它拿美工刀的話,它就不會拿起其他東西去做。

  正如Figure AI創始人說的,我們如何構建人類認知適應性的具身大腦呢?後面我給大家分享一些技術乾貨,用SNN神經網絡和BTS行為樹。

  首先第一個剛纔講了,我們用人類的認知決策去做一個功能性的因果推理。第二個,我們給它做一個功能分區,這個功能分區就是基於現在已經公布的246個腦分區做一個功能分區。第三個,我啱啱講了,一個杯子的價值在我喝水的時候纔是杯子,在我想扔垃圾的時候它就是垃圾桶,我要彈菸灰的時候它就是菸灰缸,為什麼?它有一個可共性,行為樹的底層它就是一個容器,容器訓練在哪裏?是行為樹的一個分支,而不是基於像世界模型強化學習像素點的訓練。所以說同樣的例子,我們在為一個世界模型去訓練凳子的時候,可能需要10萬張樣本,一個人類的小孩只需要坐3把椅子,就會認識世界上所有的凳子,同時他還會把路邊的石堆、台階、礦泉水箱子當成凳子去做的,還是叫可共性,就是當我累的時候沒有凳子,我去坐石堆、台階,他此刻就具備凳子的價值,也是在行為樹裏邊。

  行為樹是什麼呢?我把它分了四級體系訓練,啱啱我講了,我們會把場景的大類以及標誌性的觸發物體,包括場景的核心屬性和行為樹的節點做一個分類,這個不是模型數據的預訓練,而是在行為架構層本身,去給它做了很長的一個分類,這是頂層。分層我們會做一些物品的時序分類,對應它行為樹,還有默認的動詞以及扭曲的量級和高頻存放的場景等級,我們把它分到分支裏面。第三步,我們再把動詞分類,這個其實就是解決我們講叫Action,啱啱上一位同行說了,世界模型應該在夢境裏面去訓練,實際上具身智能三個要素,perception是我怎麼去規劃?然後imagination其實就是想象,我怎麼在虛擬的環境去訓練。然後execution就是為什麼現在機器人動的都很厲害,但是它不能夠簡簡單單給我做一頓早餐,其實就是行為樹子核心的邏輯,人類的認知是在行為、是在規則、是在底層的物理規律裏面,它並不是說我通過很多圖像和很多數據,它就會工作。然後這個動詞分類裏面有個特別常見的事情,就是我們對不同的物體顏色、性狀、形狀的東西,要訓練一個機器人的運動算法往往需要好幾套,但是你會發現,比如我拿一個遙控器、拿一杯水、拿任何一個物體,你發現「拿」的東西重量都差不多,這時候意味着什麼呢?拿東西你只要輸出一個區間的扭矩值就可以完成這樣的操作。

  下面這個是情緒交互的一個狀態分類,具體我們怎麼做呢?我們常常會把一個物品的屬性不通過圖像的像素去表述,而是把它塌縮在行為樹裏邊,當我渴了需要喝水的時候,這個東西它縮成一個具體的杯子,而且也會演化出其他的推理出來,比如說我想喝水,沒有水杯的時候怎麼辦?啱啱講了優先級,碗可不可以裝水?碟子也可以,類似的東西都可以。

  這個是我們給它做了一個叫模擬功能分區因果價值的事件決策,事件決策就是說,當我出現一個需求的時候,我的模型怎麼在行為樹裏邊去劃分,然後再把它固定成我的一個行為樹的分支,最後再演化為我的行為和動作。

  這是推理的一個鏈路,就是說原本大模型就是在它基礎上加一個動作,我們把它稱之為強化學習微調了,就是Transformer的路線,然後再去做它相應的動作。我們是把模型裏面的多模態向量激活,然後用本泊松編碼去給它降維,然後抽取到行為樹的關鍵節點,再用二進制編碼去做解碼。

  這個就是一個類腦模型的通用訓練,非常簡單,我對我的家人說,你去幫我拿一個冰可樂,他能很容易的做到,那麼讓現在的機器人去拿一個冰可樂,我得訓練建圖、訓練灶底1的場景、還得訓練冰箱、還得訓練可樂的外形,這個第一幀的訓練。我們不是處理Token,是去處理幀數,冰可樂,G就是我們腦模型的G區,然後它的輪廓、顏色就是在行為樹裏邊,然後冰可樂的特徵、語義路徑的生成、場景的標誌物,比如說這個冰箱一般在哪裏?在灶底1,灶底1裏面有什麼?有竈台、有煤氣罐,有這樣的東西,沒有人把冰箱放在臥室或者廁所。我舉個例子,比如說你今天請一個保潔阿姨,說去把冰箱裏邊過期的食品扔掉,她不會像現在非常成熟的商用掃地機器人說,我沒有來過你家,我需要現在把家裏所有房間打開去建圖,才知道冰箱在灶底1裏面,這個是不科學的。所以第一幀的構建很關鍵,就要讓機器人在行為入場裏邊知道冰箱在灶底1,那什麼樣的東西在灶底1?冰可樂一定是在冰箱裏面,它是這樣的一個邏輯。然後它的空閒狀態,包括它加急普通場景的導航,以及到運動的執行。

  第二幀的構建就是去重複第一幀的構建,去更新每個分區行為樹的狀態,SNN的作用就是當狀態發生改變的時候,我們再去更新它的行為樹。SNN的作用,現在大家可能不會像DNN、CNN了解那麼多,為什麼?因為SNN都是用在智能手環、手錶上面,就是你的心率發生變化它才監測,這個很像我們人類在開車,就是我們知道跟自動駕駛對比的時候,人類的這種智能往往是自動駕駛理解不了的,雖然很多VLA、VLM是自動駕駛遷移過來去做機器人的,你會發現人在開車的時候,你的主動意識是不再去工作的,你可能在跟副駕的人聊天,也可能在想今天晚上開會的內容,或者在想明天早上的早餐,那這個時候狀態什麼時候發生改變呢?突然有個人橫穿馬路,你的狀態是被拉回來了,纔會驅動你踩一腳剎車。

  然後我們可以看到,我們長期加入的神經網絡就是用第二幀去重複第一幀的構建,來每一層每一幀去構建一個反饋通路,來完成它的長尾訓練和解決時空向量的問題。

  最關鍵的來了,其實類腦模型通用算法的數學模型,就是在整個感知表徵層G腦區,以及實體解析層的E腦區,給它強化、提取我們的算子,去解析整個行為樹裏邊的算子。然後再去H腦區給它做場景載體的推理,比如說我的冰可樂存放在冰箱,它的所屬傳感是灶底1,這是人類的認知,我們過去我們經驗是無法通過數據表達的,所以我們纔要通過大量的異構或者真機的機器人,讓機器人試圖理解這一點。實際上不是,一個3歲小孩為什麼就知道冰箱裏面有冰可樂,這個邏輯是人類告訴他的,是寫在你基因裏面的。

  然後我們抽取屬性層,就是怎麼把這一個函數塌縮成具體的物品,就不再去通過大量的圖像計算去認識不同的物體。然後再從它的系統上C腦區走向B腦區做一個優先的評估。然後注意力決策系統,其實就是融合系統的狀態、目標和屬性、任務的評分以及輸出的動作策略和注意力的權重,最後再傳導到運動執行層,就是G腦區,就是我們講的叫體感和運動執行的層面,就是執行指令的算子,然後再執行指令的空間。

  第二幀構建的時候,我們注意力去做增益的增加,也就是說其他的模型都在用Token,我們再去抽幀數,一秒能夠分辨30幀,然後我們再做一個因果增強,然後再用SNN做系統狀態的更新。

  最後我們把整個任務理解完了以後,下發,然後變成它的控制信號,然後演變成執行的動作,它有一個記憶神經網絡在裏面編碼,就是說我們人類常見的,比如說拿、取、撇、扔、放、抓、跑、跳,它對應的東西都會訓練在這個編碼庫裏面,然後再用SNN狀態發生變化的時候去做一個抓取。

  這裏有個非常實際的例子,我們家裏都有小孩,三歲小孩不會因為這個遙控器沒有見過就不會抓,這是現在機器人的通病,拿起來它看一眼可能就撇了。然後也沒有人會說你去「拿」個冰箱過來,一定是說「搬」,我們只需要讓機器人明白,拿的時候你只需要輸出2扭到8扭的扭矩,就可以拿取不同的物體,這個時候你視覺方面的東西就會很省力。

  最後再說一下合十思維類腦模型(SNN+BTS)的本質,它不是說手寫規則,而是說我給它做一個基於成功反饋的圖結構的一個增長泛化。這裏面有一個萬能的公式,就是我把序列的效用做一個更新,然後再去成功一個指示的函數,然後策略表示它特定的樹狀結構,其實就是人類樹狀結構化認知的一個條件邏輯。強化學習是在獎勵函數下面爬坡,合十思維是什麼呢?讓機器人去舉一反三,在物理常識的知識地圖上去鋪路。

  為什麼我們可以做一個通用的具身大腦呢?倒不是說Transformer不行,是說大家的路徑不一樣,去天安門的路有很多條,我們可能是其中一條。因為我們公司現在目前是國高新、專精特新,目前也是國內唯一脫離Transformer架構,實現大規模商用化應用,並且實現規模化收入的公司。

  我本人畢業於MIT,目前是MIT PHD的博士生在讀,導師是著名的人類行為學者Max,讀的是數據科學工程管理與計算機科學,也是2012年的千人計劃回的國。

  我們的張超老師是深耕機器人社區,同時也是開源中國領域標杆級技術人物,像國內的Apache Spark、Gitee、GStar,包括OceanBase都有他參與的影子。惠炳渝博士是泛化場景的負責人,是清華大學的博士,目前國內的一些頂刊論文包括核心項目都有參與。李芹(音)是北大畢業的,他是我們的產品負責人。還有去年北京本科生成績第一,保送到北京航空航天大學的張琰東博士,負責我們的運動科學以及我們類腦運動策略優化的一個助力。

  我們目前的產品形態,就是我們類腦的操作系統,目前也完成了一些規模化的收入,可以放在我們自己的人形包括端到多端以及異構的模型以及很多的場景裏面。包括我們的一些數據已經在自己的本體和其他家的本體上面做一些訓練,產生的數據我們又會更新我們的模型,然後在場景裏面去產生更多的數據,去完成反饋的迭代閉環。

  當然我們目標是一致的,大家不管是Transformer也好,還是VLA也好,還是強化學習也好,目標都是實現AGI物理AI,讓機器人能夠進入人類的社會,去為人類工作、去探險、去為你服務,這是我們未來三年之內的願景。

  我們目前實現規模化收入的就是通用的輪臂底座,目前在商業清潔場景有非常大的規模化收入,並且今年我們也會開放酒店的商業布草場景和物流分揀的場景。我們人形的本體也實現了一些自研,包括大扭矩的關鍵模組,還有電控模組等等。

  這個人形現在在我們樓下D113展位,大家到時候也可以去參觀一下。

  參數就不介紹了,現在想做一個機器人出來,讓它有一定的運用能力已經不難了。

  這是我們的通用輪臂機器人,用在清潔場景。

  由於時間關係,我就說一下數據吧。2025年收入是8094萬,我們現在3層的業務架構就是去輸出一個硬件的設備矩陣,然後再融合一個落地的軟硬一體化解決方案,實際收益層就是我們的軟件算法和平台。我們去年是8094萬收入,今年上半年收入是7500萬。

  這是我們的一個願景,如果你是有想象力,並且對計算機、對人工智能、對物理、對應用數學感興趣的人也可以加入我們,如果你是投資人,如果關注一些用AI非共識方法的賽道也可以聯繫我們,我們展位在D113,也希望大家對我們有一些關注,我是合十思維的創始人趙普。

  謝謝大家!

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10