在2026年中国国际服务贸易交易会的“物理AI与具身智能机器人创新生态交流会”专题活动中,晰见科技创始人兼CEO杨哲宇发表了主题演讲,深入探讨了视觉感知技术在未来AI发展中的关键角色与变革方向。杨哲宇首先介绍了晰见科技的深厚背景,指出公司源自清华大学类脑计算研究中心,该中心由清华联合七个院系共建,其代表性成果“天机芯”和“天眸芯”均荣登《Nature》封面文章,彰显了其在学术界的顶尖地位。
杨哲宇提出一个引人深思的问题:为何大语言模型动辄拥有万亿级参数,而视觉模型,特别是部署在具身智能和端侧的VLM、VLA,参数规模却通常仅有数十亿?他认为,这背后的核心瓶颈在于视觉与文本两种模态的天然对立性。人类言语每秒仅能输出几个Token,而一张1080P图像就包含8000个Token,若处理每秒30帧的视频,Token数量将激增至24万。面对如此庞大的数据流,即便是最先进的端侧GPU在运行小型模型时,每秒也仅能处理300个Token,这种数量级的巨大鸿沟,直接导致了视觉模型的发展远远落后于语言模型。
为了打破这一僵局,杨哲宇阐述了天眸芯的革命性原理。他指出,传统图像传感器为满足人类视觉需求,采取均匀采样的方式,导致分辨率、帧率和画质三者相互制约,这也是手机背面需要配备多摄像头的原因。相比之下,天眸芯借鉴了人眼的视觉注视点机制,不再均匀记录所有信息,而是将空间边缘、色彩变化、时间动态和深度距离等“视觉基本元语”以稀疏、量化的形式表达。这种创新不仅能够实现高精度去量化并支持画面无损重建,更重要的是,它能在芯片上直接进行稀疏计算,有效评估每个Token的信息价值,随后通过内存重排和RDMA技术,将经视觉原语压缩90%后的数据直通GPU。这种为AI量身定制的数据形式虽然无法被人眼理解,却完美契合了Transformer、VLM、VLA及世界模型的处理范式,能显著降低模型响应延迟(TDFT)和训练成本。
基于此,杨哲宇做出大胆预测:在未来两年内,面向人的视觉展示方案与面向AI的视觉输入方案,必将分化为两个截然不同的技术路径。他重新定义了天眸芯的产品定位——一种全新的Token Camera,其基本单位不再是服务于人眼观看的帧和像素,而是高效的Token。他特别指出,在智能可穿戴设备领域,仅仅为了拍照而增设摄像头并无意义,真正的价值在于将其无缝接入大模型的理解能力,使之成为Physical AI的感知端口,这才是未来核心的发展方向。
演讲最后,杨哲宇以“数跳绳”这一应用场景为例,展示了视觉通用性的巨大潜力。他认为,一旦视觉具备通用性,自然语言将成为最好的编程语言,每个相机都能成为用户的个人助理,通过提示词即可完成从前需要大量数据标注、模型训练和复杂规则编写的视觉任务。这将彻底改变软件开发模式,使视觉应用的创建过程变得像操作标品相机一样简单。他总结道,英伟达将电子输入转化为智能Token,而晰见科技与天眸芯的使命则是将光子转化为有效的Token,将物理世界的光线输入变成大模型理解世界的端口。未来的Physical AI概念将远超具身智能的范畴,它不仅涵盖机器人的操作,更包含对机器人的精细控制,为整个AI产业开辟了新的想象空间。