专题:中国国际服务贸易交易会 物理AI与具身智能机器人创新生态交流会

服贸会专题活动“物理AI与具身智能机器人创新生态交流会”于2026年9月11日在京举办。复旦大学可信具身智能研究院特聘教授、OpenFriday创始人范建平出席并演讲。
以下为演讲实录:
范建平:大家下午好,很高兴能够有机会来参加这个会议,来介绍最近的一些工作,我们知道未来的机器人不是一个大型的遥控玩具,它必须是有一个灵魂在里面运行,这个灵魂就是智能体。那么未来的机器人它不仅要在Cyber Space去运行,而且要在Physical Space去完成一定的Action,必然它的智能体就是Cyber-Physical Agents。所以今天的这个报告我们简单的介绍一下我们面向未来具身智能Cyber-Physical Agents。简单地介绍一下架构,我们的一些实现,它的应用和面临的挑战。
因为Cyber-Physical 智能体要同时运行在Cyber Space,还要在Physical Space执行一些Action,所以它需要两个大脑,我们把它叫做dual model for embodied cognition。它除了传统的智能体的各类组件(component),例如长短期记忆、工具库、数据库、技能库,还有长程规划的能力,当然还有随着时间和空间的变化,它能够不断的进化的能力之外,它还要有能力在物理空间去控制机器人的Moving(移动)和Action(动作),所以它必须有双重大脑。
我们在过去的几年当中开发了Cyber Physical Agent的开发平台,包括很多的Component,像如何去Develop the Agent,如何model the fine tuning,还有如何去处理data,还有knowledge,还有Multi Agent collaboration以及inference端的加速。有了这个平台以后,我们可以向下支持所谓的Agent Native Device,像Robot、AI Phones、AIPCs,向上可以支持Smart Solution,例如Smart Manufacture,因为未来的机器人不能是简单的遥控玩具,它必须进入到工厂、车间去为人民服务,就像原来的首钢一样,必须为人民服务,否则它就会死掉。
首先我来介绍一下它如何来support智能体原生的硬件。我们知道每一个硬件的发展其实跟智能的发展是相关的。首先PC出来了之后有internet,2001年联想就发明了internet PC,移动(mobile)技术出现、无线通信(wireless communication)问世之后,我们就有了智能手机(Smart Phone),也就是我们小时候所谓的大哥大,一路发展到今天的Smart Phone。AI出来之后,它必然会重构所有的这些硬件设备,我们把它定义叫做AI Native Device。那么AI时代现在最热的一点就是Agent,肯定也会出现很多Agent Native Device。也就是说未来的Device,它的Intelligence是靠着里边的Agent来support的。
什么叫做Agent-Native Device?它必须要有更强的大脑、更强的软件,也就是Agent,一个更聪明的Agent,而且它必须要有更强的计算设备来承载这个东西,就像NVIDIA前段时间发布的RTX一样。如果没有一个强的硬件设备计算能力,它是不可能承载大模型的Intelligence,而且未来真正的Agent-Native Device必须是软硬件协同设计(co design),它们要协同进化,包括三层:智能体、OS、硬件层,每一层负责(handle)不同的任务,Agent这一层主要是理解用户的意图,它是一个task decomposition,还有执行一些在Cyber Space的一些Action。然后OS主要是做model inference acceleration,还有task scheduling,当我们有多的task的时候,它如何去安排时间。当然还有传统的PC或者其他的Device的OS一样,它要handle memory scheduling,还有其他的东西。还有最近比较火热的Agent Harness,当然它也依赖最底层的芯片组(chipset),就是说它的计算能力也是非常重要的。在这种情况下,我们会希望Cyber Physical Agent不仅能执行在Cyber Space的sorting,还有Physical Space的一些Action,所以我们把它叫做长程复合任务,它不仅要去Plan Cyber Space 的thought,还要Plan Physical Space的一些Action,所以它的Plan会比传统的复杂一些。
为什么现阶段我们可以讨论Agent Native Device呢?因为软件和硬件,现在它们的能力,就是Agent的Intelligence现在在不断的增强,我们知道有很多端侧的大模型,它的知识的密度在不断的增长,我们有可能有那么一天,我们是可以develop一些大模型的,它的规模(size)是相对有限(limited),但同时它的Intelligence可以达到一定的高度。我们的硬件(hardware)它的承载能力、计算能力也可以随着时间不断的发展,像NVIDIA的RTX一样,在相向而行的情况下,今天我们是可以去讨论智能体原生的硬件的,这就是为什么会有AI PC、AI Phones这些概念出来的原因。它的主要形态就像PC Phone,还有很重要的一个是Robot,未来的Robot必须有一个Agent运行在其中去control,去理解人类需求(human demand)并执行对应的物理行为,并且它可以随着时间自适应不同的环境与不同的任务,这是未来我们希望能够去看到的。
介绍完了Agent Native Devices,我简单介绍一下这套平台如何去Support Smart Solution。我们知道中国是一个靠制造业起家的国家,所以我们希望这一套东西能够更好地Support Smart Manufacture。那么Smart Manufacture全栈的这些东西,首先引擎控制(engine control),有一些安全(Security)比较高的公司,它是有这种engine control的。第二,当我们做到table前的时候,我们首先会问自己一个问题,今天会来什么样的订单,就是Demand Forecasting(需求预测),订单来了之后我们怎么去安排生产,安排生产完之后,在产线上我们怎么去control质量。像联想这样的international公司,它如何去规避关税,怎么把半成品shift到墨西哥,然后再组成成品。那么如何用空运、海运等各种各样的运输的办法节省开销的情况下,以最便宜的价格去把这些半成品shift到墨西哥,再组装,还有就是售后服务。
今天主要简单介绍两个东西:Demand Forecasting和Quality Control。Demand Forecasting,所谓供应链(Supply Chain)专家会做出大量假设(hypothesis),所谓hypothesis(假设),就是天气、海洋气候等各类因素发生变化,会带来订单的变化。我们的智能体会根据这些hypothesis做一个prediction(预测),就是今天可能会收到什么样的订单。根据这些prediction的结果,专家可以参与(involve)在其中,就可以去check这个prediction是否合理,根据过去的经验(看看)它是否合理。如果不合理的话,他可以生成另一项假设(make another hypothesis),去改变过去的一些不合理的hypothesis。然后make another demand forecast agent,会make agent decision,make another prediction,然后会得到另外一个结果,周而复始,我们就可以得到一个reasonable的Forecasting,然后来安排生产。从这里可以看到,AI永远不可能取代人类,人类在always在最终环节,做出最终决策。
当我们安排了这些生产以后,我们就要在产线上面去做这些共产,我们就要去控制产品的质量,缺陷检测是一个非常重要的issue,如果用AI来完成缺陷检测让Quality提升是非常重要的,所以我们也develop了一个缺陷检测智能体。产线上的工人可以给Agent下指导的command,它会去执行。当它有了这些Smart Manufacturing Solution以后,其实我们的最终目标是希望能够组建一个未来的AI Native的organization。也就是说,不仅有普通的人类的员工,未来会有AI的员工,那么AI的员工和人类的员工如何通力协作去解决生产产线上的一些问题,未来我们会develop,就是所谓的数字员工,运行在Cyber Space的这些员工,还有救生的员工,同时他以救生的形式环绕在产线上的这些员工,如果我们能够做到这一点的话,未来就可以给我们解决非常多的问题。
虽然这些前景是非常美好的,但是实体端的各类设备还是遥控玩具,它能够解决一些具体的well defined的问题。为什么现在大模型可以如此的聪明,我们具身做不到这一点?因为在大模型出来之前,互联网产业已经发展了很长的时间,积累了大量的数据,而相反具身这些数据是非常难以采集的,这是为什么很多具身的公司伏下身段去做数据采集的工作,而且这个代价是非常高昂的。
第二,Cyber-Physical Agent不仅要做Cyber Space层面的行动规划,同时还要完成物理空间(Physical Space)层面的行动规划,它是一个复合的长程任务,它会面临很多的瓶颈,和现在的大模型面临的瓶颈是一样的。因为物理环境是变化万端的,所以导致在物理环境中运行的这些AI系统,它的泛化能力会非常的差。还有一个很重要的原因,我们面向边端设备的时候有一个很重要的限定条件是它的功耗还有端侧的算力,这两个大的限制,导致现在的Cyber -Physical智能体变得非常难以落地,当我们讨论AI员工和人类员工一起工作的时候,我们要讨论伦理规范,这是为什么我们的研究员叫做可信具身智能,也就是说它不仅要去研究具身智能本身的问题,我们也要研究一些伦理的问题。
谢谢大家!