视觉感知的双重标准:为何未来AI需要专属的“视觉语言”

Deep News
4 hours ago

在2026年中国国际服务贸易交易会的“物理AI与具身智能机器人创新生态交流会”专题活动中,晰见科技创始人兼CEO杨哲宇发表了主题演讲,深入探讨了视觉感知技术在未来AI发展中的关键角色与变革方向。杨哲宇首先介绍了晰见科技的深厚背景,指出公司源自清华大学类脑计算研究中心,该中心由清华联合七个院系共建,其代表性成果“天机芯”和“天眸芯”均荣登《Nature》封面文章,彰显了其在学术界的顶尖地位。

杨哲宇提出一个引人深思的问题:为何大语言模型动辄拥有万亿级参数,而视觉模型,特别是部署在具身智能和端侧的VLM、VLA,参数规模却通常仅有数十亿?他认为,这背后的核心瓶颈在于视觉与文本两种模态的天然对立性。人类言语每秒仅能输出几个Token,而一张1080P图像就包含8000个Token,若处理每秒30帧的视频,Token数量将激增至24万。面对如此庞大的数据流,即便是最先进的端侧GPU在运行小型模型时,每秒也仅能处理300个Token,这种数量级的巨大鸿沟,直接导致了视觉模型的发展远远落后于语言模型。

为了打破这一僵局,杨哲宇阐述了天眸芯的革命性原理。他指出,传统图像传感器为满足人类视觉需求,采取均匀采样的方式,导致分辨率、帧率和画质三者相互制约,这也是手机背面需要配备多摄像头的原因。相比之下,天眸芯借鉴了人眼的视觉注视点机制,不再均匀记录所有信息,而是将空间边缘、色彩变化、时间动态和深度距离等“视觉基本元语”以稀疏、量化的形式表达。这种创新不仅能够实现高精度去量化并支持画面无损重建,更重要的是,它能在芯片上直接进行稀疏计算,有效评估每个Token的信息价值,随后通过内存重排和RDMA技术,将经视觉原语压缩90%后的数据直通GPU。这种为AI量身定制的数据形式虽然无法被人眼理解,却完美契合了Transformer、VLM、VLA及世界模型的处理范式,能显著降低模型响应延迟(TDFT)和训练成本。

基于此,杨哲宇做出大胆预测:在未来两年内,面向人的视觉展示方案与面向AI的视觉输入方案,必将分化为两个截然不同的技术路径。他重新定义了天眸芯的产品定位——一种全新的Token Camera,其基本单位不再是服务于人眼观看的帧和像素,而是高效的Token。他特别指出,在智能可穿戴设备领域,仅仅为了拍照而增设摄像头并无意义,真正的价值在于将其无缝接入大模型的理解能力,使之成为Physical AI的感知端口,这才是未来核心的发展方向。

演讲最后,杨哲宇以“数跳绳”这一应用场景为例,展示了视觉通用性的巨大潜力。他认为,一旦视觉具备通用性,自然语言将成为最好的编程语言,每个相机都能成为用户的个人助理,通过提示词即可完成从前需要大量数据标注、模型训练和复杂规则编写的视觉任务。这将彻底改变软件开发模式,使视觉应用的创建过程变得像操作标品相机一样简单。他总结道,英伟达将电子输入转化为智能Token,而晰见科技天眸芯的使命则是将光子转化为有效的Token,将物理世界的光线输入变成大模型理解世界的端口。未来的Physical AI概念将远超具身智能的范畴,它不仅涵盖机器人的操作,更包含对机器人的精细控制,为整个AI产业开辟了新的想象空间。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10