7月21日,小鹏集团正式发布其自研的TuringViT高效视觉编码器。该技术旨在为智能驾驶、智能座舱及人形机器人等业务提供统一的感知底座,并通过重构视觉大模型的训练范式,为行业提供一条低成本、可复现的技术路径,推动先进视觉模型从“头部团队专属”走向“行业普惠”。

突破行业瓶颈,重构训练范式
当前,视觉编码器作为物理AI的“感知入口”,其性能直接决定了场景理解与决策的质量。然而,行业普遍面临三大瓶颈:高分辨率场景下算力成本高昂、主流模型依赖百亿级海量数据但收益递减、固定分辨率预训练与下游动态需求不匹配。
小鹏集团方面表示,TuringViT从架构、数据、训练三个维度同步突破,系统性地解决了上述难题。
在架构上,TuringViT创新性地提出Turing线性注意力(TLA)作为核心计算单元,将计算复杂度从二次方降至近线性。实测数据显示,在1536×1536高分辨率下,TuringViT-18L的推理吞吐量达到同类基线模型的3.04倍,为高分辨率感知在车端等端侧设备的部署扫清了障碍。
在数据上,TuringViT摒弃了“堆数据规模”的粗放路线,打造了VISTA-Curation多模态数据治理流水线。通过精细化筛选,该技术仅用0.85B图文对(约为同类主流模型训练数据规模的10%),便在多项零样本分类基准上取得83.6%的平均准确率,超越了使用10B数据训练的开源基线,实现了“十分之一数据,更优效果”的突破。
在训练上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游任务的输入特性,彻底告别了“固定分辨率预训练+事后适配”的传统模式,大幅降低了集成适配成本。
赋能三大业务,筑牢技术闭环
随着TuringViT的发布,小鹏集团在物理AI领域的底层技术能力进一步完善,并将全面赋能其三大核心业务。
在智能驾驶领域,TuringViT作为第二代VLA模型的核心视觉编码器,其近线性的延迟特性使得高分辨率视觉感知得以在车端算力约束下稳定运行,将助力窄路通行、复杂路口处理等功能的体验升级。
在智能座舱领域,其VLM(视觉语言模型)原生特性让视觉特征与语言模型实现更高效地对齐,可支撑更丰富的座舱交互功能。
在人形机器人领域,TuringViT将充当IRON机器人的“视觉视网膜”,为其提供物体识别、空间关系理解等基础感知能力。统一的基座架构也让智能驾驶场景积累的视觉经验能够快速迁移至机器人场景,加速其落地进程。
开放技术路径,促进行业发展
小鹏集团表示,TuringViT的价值不仅在于内部业务的落地,更在于为行业提供了一套可复现、可迁移的SOTA级(State-of-the-Art,最新技术水平)视觉大模型训练方法论。
其核心架构设计、数据治理流程与训练范式均不依赖特定硬件平台,有望降低高性能视觉编码器的训练与定制门槛,使更多团队能够在可控算力条件下构建面向自身业务的视觉基础模型,从而推动整个AI产业的技术进步与应用普及。
(文章来源:广州日报新花城)