视觉感知的双重标准:为何未来AI需要专属的“视觉语言”

Deep News
4小時前

在2026年中国国际服务贸易交易会的“物理AI与具身智能机器人创新生态交流会”专题活动中,晰见科技创始人兼CEO杨哲宇发表了主题演讲,深入探讨了视觉感知技术在未来AI发展中的关键角色与变革方向。杨哲宇首先介绍了晰见科技的深厚背景,指出公司源自清华大学类脑计算研究中心,该中心由清华联合七个院系共建,其代表性成果“天机芯”和“天眸芯”均荣登《Nature》封面文章,彰显了其在学术界的顶尖地位。

杨哲宇提出一个引人深思的问题:为何大语言模型动辄拥有万亿级参数,而视觉模型,特别是部署在具身智能和端侧的VLM、VLA,参数规模却通常仅有数十亿?他认为,这背后的核心瓶颈在于视觉与文本两种模态的天然对立性。人类言语每秒仅能输出几个Token,而一张1080P图像就包含8000个Token,若处理每秒30帧的视频,Token数量将激增至24万。面对如此庞大的数据流,即便是最先进的端侧GPU在运行小型模型时,每秒也仅能处理300个Token,这种数量级的巨大鸿沟,直接导致了视觉模型的发展远远落后于语言模型。

为了打破这一僵局,杨哲宇阐述了天眸芯的革命性原理。他指出,传统图像传感器为满足人类视觉需求,采取均匀采样的方式,导致分辨率、帧率和画质三者相互制约,这也是手机背面需要配备多摄像头的原因。相比之下,天眸芯借鉴了人眼的视觉注视点机制,不再均匀记录所有信息,而是将空间边缘、色彩变化、时间动态和深度距离等“视觉基本元语”以稀疏、量化的形式表达。这种创新不仅能够实现高精度去量化并支持画面无损重建,更重要的是,它能在芯片上直接进行稀疏计算,有效评估每个Token的信息价值,随后通过内存重排和RDMA技术,将经视觉原语压缩90%后的数据直通GPU。这种为AI量身定制的数据形式虽然无法被人眼理解,却完美契合了Transformer、VLM、VLA及世界模型的处理范式,能显著降低模型响应延迟(TDFT)和训练成本。

基于此,杨哲宇做出大胆预测:在未来两年内,面向人的视觉展示方案与面向AI的视觉输入方案,必将分化为两个截然不同的技术路径。他重新定义了天眸芯的产品定位——一种全新的Token Camera,其基本单位不再是服务于人眼观看的帧和像素,而是高效的Token。他特别指出,在智能可穿戴设备领域,仅仅为了拍照而增设摄像头并无意义,真正的价值在于将其无缝接入大模型的理解能力,使之成为Physical AI的感知端口,这才是未来核心的发展方向。

演讲最后,杨哲宇以“数跳绳”这一应用场景为例,展示了视觉通用性的巨大潜力。他认为,一旦视觉具备通用性,自然语言将成为最好的编程语言,每个相机都能成为用户的个人助理,通过提示词即可完成从前需要大量数据标注、模型训练和复杂规则编写的视觉任务。这将彻底改变软件开发模式,使视觉应用的创建过程变得像操作标品相机一样简单。他总结道,英伟达将电子输入转化为智能Token,而晰见科技天眸芯的使命则是将光子转化为有效的Token,将物理世界的光线输入变成大模型理解世界的端口。未来的Physical AI概念将远超具身智能的范畴,它不仅涵盖机器人的操作,更包含对机器人的精细控制,为整个AI产业开辟了新的想象空间。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10