星动纪元陈建宇:具身智能和大模型一样可以结合千行百业,已进入商业化拐点

IPO早知道
Yesterday
作者:MD

出品:明亮公司

820日,2026世界机器人大会期间,星动纪元创始人陈建宇发表了主题为《大脑、本体与场景的共生进化》演讲,分享了公司在通用机器人、具身大模型、世界动作模型(WAM)、人形机器人本体、五指灵巧手、运动控制和商业化落地方面的最新进展与思考。

公开信息显示,成立于20238月,是清华大学唯一直接持股的具身智能企业,由清华交叉信息研究院孵化,陈建宇为清华大学副教授、博士生导师。公司坚持"AI-Native"软硬一体全栈自研,构建"数据大脑运控灵巧手本体"全链条能力,硬件自研率超95%,核心产品包括全尺寸双足人形机器人星动L7、轮式服务机器人星动Q5XHAND全直驱灵巧手。

公司最新一轮融资公布于20267月,融资规模为10亿元、由诚通基金领投,多家知名机构跟投。据AlphaEngine数据库,公司2026年共宣布完成3轮融资,规模分别为10亿元(公布于3月)、超2亿美元(4月)和7月的10亿元。

据外媒信息,星动纪元正在筹备赴香港联交所主板上市

公司今年融资信息(来源:AlphaEngine

在大会演讲中,陈建宇认为,经过过去几年的发展,通用机器人、人形机器人和具身智能的巨大潜力已经逐渐成为行业共识。未来,这一方向会成为万亿级超级市场:

“第一步,机器人会带来生产力变革,帮助人类更好地生产电脑、手机、汽车等现有产品;第二步,机器人本身可能成为继智能终端之后的下一代终端产品,并以某种家用机器人的形式进入日常生活。”陈建宇表示。

在他看来,更加通用的机器人需要具备两个特征:第一,上限更高,拥有更高自由度和更高智能,能够完成过去机器人不能完成的事情,从而打开市场;第二,泛化性更强,面对新任务时,不必像专用机器人一样重新开发硬件和软件,而是能够复用已有能力和系统。

围绕这一目标,星动纪元选择了软硬一体、全栈自研路线:在大脑侧,自研端到端具身大模型、世界动作模型(WAM);在本体侧,自研双足本体、关节、灵巧手和运动控制,并将大脑、本体、场景协同起来,形成一个持续迭代的数据与能力飞轮。

陈建宇在演讲中提到,打造通用机器人,避不开同时做它的大脑和本体;世界模型要构建对物理世界常识性的理解,这种理解具备比较好的泛化性;从今年开始,具身行业已经进入商业化拐点;星动纪元希望用通用的形态,逐步去做具体专用场景,让能力和数据在下一个场景中继续复用。

以下为“明亮公司”根据现场速记精编后的演讲内容(未经演讲人审阅):

来源:WRC、星动纪元(下同)

通用机器人:大脑、本体和场景的协同进化

非常感谢主办方的邀请和介绍,在这里跟大家分享一下我们做的相关工作和一些思考。

经过这几年的发展,大家已经意识到通用机器人、人形机器人和具身智能的巨大潜力。它未来一定会成为万亿级超级大的市场。

首先,它可能带来生产力的变革,帮助我们更好地生产电脑、手机、汽车等产品。第二步,它自己就会成为继智能终端之后的下一代智能终端产品,可能以某种家用机器人形式存在。

这里面非常重要的关键点,是能不能打造更加通用的机器人。

这样的机器人具备两个特征。第一,它的上限更高,有更高的自由度、更高的智能,所以能做到很多以前机器人不能做到的事情,把市场整个打开。第二,它更加通用,泛化性更强。所以我们做新的事情时,不像以前专用机器人一样,需要重新开发硬件和软件,里面绝大部分东西都可以直接复用和泛化。

打造通用机器人,避不开同时做它的大脑和本体。星动纪元围绕这个目标,这几年已经实现了通用机器人软硬一体、全栈自研的多项突破。

包括大脑这一块,我们自研了端到端具身大模型;在运动控制和本体侧,我们自研双足本体、关节和灵巧手,并且把它们很好地整合到一起。最重要的是把大脑、本体和场景协同起来,做成一个协同进化的飞轮。

最上层是端到端具身大脑大模型,里面包括VLA、世界模型、数据等。它是通用模型,能够支配多种本体,用到不同场景里。中间层是本体,因为具身模型和大脑最终要产生价值,一定要放在某个本体上,才能跟物理世界进行交互,真正去干活,所以这一层也非常重要。最终,我们可以把它用到各类场景里面。

如果设计比较得当,大脑是通用的,本体也是比较通用的,那么它用到各类场景里,就都应该可以比较通用地进去。在场景应用过程中,我们又可以不断获得很多数据反馈,这些反馈进一步反哺大脑发展。

通过这种方式,可以把技术和商业化很好地协同起来,形成协同进化的飞轮。

VLA到世界动作模型:让机器人理解物理世界

下面具体讲一下我们的思路和做法,首先是具身大脑层面。

我把具身大模型迭代方式,到目前为止列成三个范式。

第一个范式,是语言模型加机器人的控制。所有一切都是从ChatGPT大模型出现后开始的。最开始ChatGPT语言大模型出现之后,我们探索的是能不能把语言大模型用在机器人里面,但整个框架还是传统模块化机器人框架的思路,只是用语言模型增加上层推理。

第二阶段,是2023年以GPT-4为代表,多模态语言模型出现了,可以把视觉等信息融入进来。这个阶段对应到具身模型,就是VLA模型,即视觉-语言-动作模型。它在多模态模型底座之上,把机器人非常重要的动作,以及和环境交互的功能,一起融合到统一模型里面。

第三阶段是世界模型。AI大模型这一侧,比较早的代表是2024Sora第一代模型,现在类似方向也发展得非常迅速。具身智能这块基于类似方法,做出了世界动作模型。这样的模型能够预测未来产生的动作,并对决策形成闭环。

在这三个阶段,我们都做出了一些引领性工作。比如在第一个阶段,我们较早做出了全球首个大语言模型结合人形机器人的工作。

它以语言模型作为上层规划,但下层感知、控制、执行仍然由传统模块化机器人控制方法完成。我们很快意识到,传统分层方法有局限性,因为它把感知、规划、控制、执行都模块化处理,只是把语言模型替代了最上层规划。模块之间的特征和接口都是人工定义的,也没法进行端到端训练。

不管是语言模型还是视觉模型,都经过了从模块化、人工定义特征,到端到端、靠数据Scaling最终取得成功的过程。具身智能也应该沿着类似范式,这就来到端到端VLA模型。它把视觉、语言、动作等各种模态,以及感知、决策、规划、控制等多个层面的功能,融合到一个模型中,这样就可以把大量数据Scale起来。

现在典型VLA模型有很多,比如π0系列、GR00THelix。这些VLA模型统一的范式,是以多模态语言模型为底座,再加上Action Expert或者Action Head,端到端进行训练。类似这样的范式,我们在2024年就以公开论文形式发表过。

为什么现在还需要做世界模型?

这要说到典型VLA模型的局限性。它非常好的一点,是找到一种方法能够把多模态端到端地用一个模型训练,并呈现出比较好的Data Scaling效果。但它的学习方法主要还是通过模仿学习,所以需要采集大量人类行为数据。只有大量行为数据,模型才能通过模仿形成一定泛化性。

但这种泛化性相对有限。一个新任务如果没有经过模仿,很难直接举一反三泛化过去。

世界模型则要构建对物理世界常识性的理解,而这种常识性理解具备更好的泛化性。比如水杯往下倒,水就会往下流。你不需要一遍遍去学习这个动作,只要具备一定常识性理解和推理,就有望大幅提升泛化能力。

从功能上看,世界动作模型包含了所有VLA功能。它的输入包括以视觉为代表的感知输入,也包括语言Prompt;输出上,一方面要产生Action,也就是动作,另一方面比VLA多了一部分:对物理世界未来演化和发展进行预测。

在具体实现上,二者较大的区别是智能底座。VLA的智能底座是多模态语言模型,最底层的智能内核在语言智能空间。它的优势是抽象思维较强、泛化性较好,但缺点是可能缺少细节物理层面的信息和理解。世界动作模型很多以视频模型为底座,视频模型直接处理原始图像、视频、音频等数据,而这些原始感知数据包含更丰富的物理世界细节。因此,我们认为它更适合物理世界操作的具身模型。

沿着这个思路,我们做出了一系列工作。早在2024年,我们就发表了世界动作模型工作,这是全球首个融合视频预测与动作预测的世界动作模型,基本也是现在标准世界动作模型的范式。我们的发表时间比英伟达类似方案早一年左右。

在此基础上,我们做了很多改进。比如数据层面,用了世界模型之后,它对数据吸收能力比较强。我们提出了全球首个大规模基于人类视频数据的世界动作模型训练方案,并在2025年发表相关论文,把机器人真机数据和第一人称人类操作数据结合起来一起训练。

我们也与Physical Intelligence联合创始人Chelsea Finn合作了ControlWorld,进一步提高动作行为的精准可控性。把世界模型用到真实世界中,有了反馈之后,还可以继续对它进行迭代和强化学习。

在模型能力上,世界模型很重要的一点是对复杂物理世界进行建模和预测。我们展示过两幅图,一幅是世界模型生成的,一幅是真实世界实拍的,大家几乎分辨不出来哪个是生成、哪个是实拍。

通过大量数据和比较好的网络设计,世界模型可以比较精准地预测复杂物理现象。比如毛巾褶皱、从纸巾盒抽出一张抽纸等非常细微的操作,也能比较好地建模出来,这对精细操作非常有利。

我们也做了一些零样本任务泛化的例子。零样本任务泛化,是我们对泛化的终极追求。现在的VLA模型可以比较好实现物品泛化,比如换一个物品或者物品位置变化,它可能还能泛化;但到了一个新任务,通常很难实现。我们希望新的任务没有见过、没有训练过、没有收集数据,也可以做到一定程度泛化。

零样本的意思是,到新任务上不再收集数据,直接拿预训练模型,看它能不能一定程度泛化过去。我们发现了一些比较好的初步结果。比如我们在自己的办公区随机找一些场景拍摄作为输入,再随机给一些任务指令。这些任务带有相对复杂的语义理解,模型能够端到端把行为动作直接预测出来。

经过比较多的后训练之后,我们可以看到它能做一些比较精细的操作,比如叠纸盒,翻袜子,把袜子从里到外翻出来,再比如剥橘子或者开锁。这些比较精细的操作也能够做到。

我们的模型也具备一定跨本体能力,比如能够操作比较复杂的灵巧手。操作灵巧手之后,就可以做工具使用,比如用螺钉枪打螺钉,或者使用移液器。不只是把工具拿起来移动到对应位置,还要用大拇指按下按钮,再做相应操作。这些能力也获得了一些国际榜单和奖项认可。

从零样本泛化到本体自研:通用机器人需要匹配的大脑和身体

当我们有了一个不错的大脑之后,也要有与之相匹配的本体。

对于通用人形机器人来说,一个是灵巧手,一个是双足,这都是此前没有成熟产品的方向。还包括灵巧手、双足和全身高自由度人形机器人的运动控制,这跟传统机械臂控制完全不是一回事。所以这一块,我们也全栈自研了本体硬件体系和运动控制。

本体方面,从整机到部件再到零件,我们都自研。部件包括关节模组和灵巧手,零件包括电机、减速器、驱动器,这些都是自己设计,并且达到很高指标。同时,我们也自研运动控制算法,现在主要通过强化学习来做。

我们的全尺寸高爆发双足人形机器人本体硬件,有比较高的力量和速度,关节扭矩达到400牛米,跟小米SU7汽车的扭矩差不多。机器人高度17,重量六七十公斤,自由度比较高,载荷、速度和工作空间都比较大。因为我们设计出来,就是希望它能够通用地进入现实物理世界,干更多样的活。

为了达到这种状态,我们也是国内较早发展准直驱关节路线的团队之一。现在很多人形机器人可以跑得很快、跳得很高,都是用了新型准直驱关节路线。

在运动控制上,我们也做了很多工作。其中一个代表是2024RSS最佳论文提名奖。RSS是机器人领域最顶级会议之一,这也是历史上首次中国第一作者单位获得相关奖项。

灵巧手与商业化:今年具身行业已进入商业化拐点

接下来讲一下五指灵巧手。

五指灵巧手是末端执行器的更新。以往在工业领域主要使用夹爪或者吸盘,它们通常只有一个自由度,只能把物品夹起来再放到另一个地方,很难把物品位置翻转,或者做手内操作。五指灵巧手则可以像人一样做非常复杂的操作。

另一个非常重要的点是,现在很多数据来自人类行为数据。用五指灵巧手,能够更好地跟人类行为匹配,所以我们能更好地把人类行为数据用上。

现在灵巧手主要有三大技术派系:连杆、腱绳驱动和直驱。我们在全行业首创并较早推出全直驱五指灵巧手产品,2024年推出了XHAND系列灵巧手,现在在市场上比较受欢迎。

直驱有比较多好处和优势,其中最大优势是响应速度非常快,我们的手一秒钟能够点击10次鼠标,达到超人类水准。因为有比较好的反驱能力,抗冲击能力也比较强,稳定性很高,同时可以做到单手24千克负载。

把软件硬件做好之后,最终最重要的是到商业化场景里面落地。

我们为什么同时做软件和硬件?因为希望打造完整产品,最终提供完整解决方案,交付到终端用户里面。我们会从物流、工业开始,逐步往服务和To C、家用方向渗透。另一条线是,在这个过程中,我们把硬件平台、一些软件工具链和API开放出来,供二次开发者或者研究者使用,或者进一步拓展。

我们认为,从今年开始,具身行业已经进入商业化拐点。以我们自己为例,B端客户已经涵盖十余个城市,在各种物流和工业场景里进行常态化运作,而不仅仅是拍一个Demo。现在各行各业对机器人都非常关注。

机器人就像AI大模型一样,AI大模型可以跟各行各业结合,通用人形机器人和具身智能也可以跟各行各业结合。从互联网大厂,到汽车主机厂,再到3C电子公司、物流公司等,都对此有非常多需求。

比如在物流分拣场景中,我们已经有一些应用案例。同时,我们开放硬件本体、一定API和软件工具链,也有很多用户基于这些工具链搭建自己的应用,或者做新型研究,已经形成不少生态用户和相应成果。

总结一下,在具体物流场景中,我们直接用端到端具身大模型、人形机器人和灵巧手,用通用形态逐步去做具体专用场景。这样做的目的,是希望通用形态能够持续迭代。到下一个场景时,我们不需要重新搭建一整套软硬件系统;之前场景所构建出来的能力和数据,都可以得到比较好的复用。在此基础上,随着系统能力发展,我们可以不断开拓更新场景。这样的进化飞轮,我们已经初步建立起来。

感谢大家的支持,这是我今天的分享,谢谢。

| 发福利!添加下方明亮公司主编微信有惊喜!

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10