低成本,可復現,小鵬集團發布TuringViT視覺模型

廣州日報新花城
昨天

  7月21日,小鵬集團正式發布其自研的TuringViT高效視覺編碼器。該技術旨在為智能駕駛、智能座艙及人形機器人等業務提供統一的感知底座,並通過重構視覺大模型的訓練範式,為行業提供一條低成本、可復現的技術路徑,推動先進視覺模型從「頭部團隊專屬」走向「行業普惠」。

  突破行業瓶頸,重構訓練範式

  當前,視覺編碼器作為物理AI的「感知入口」,其性能直接決定了場景理解與決策的質量。然而,行業普遍面臨三大瓶頸:高分辨率場景下算力成本高昂、主流模型依賴百億級海量數據但收益遞減、固定分辨率預訓練與下游動態需求不匹配。

  小鵬集團方面表示,TuringViT從架構、數據、訓練三個維度同步突破,系統性地解決了上述難題。

  在架構上,TuringViT創新性地提出Turing線性注意力(TLA)作為核心計算單元,將計算複雜度從二次方降至近線性。實測數據顯示,在1536×1536高分辨率下,TuringViT-18L的推理吞吐量達到同類基線模型的3.04倍,為高分辨率感知在車端等端側設備的部署掃清了障礙。

  在數據上,TuringViT摒棄了「堆數據規模」的粗放路線,打造了VISTA-Curation多模態數據治理流水線。通過精細化篩選,該技術僅用0.85B圖文對(約為同類主流模型訓練數據規模的10%),便在多項零樣本分類基準上取得83.6%的平均準確率,超越了使用10B數據訓練的開源基線,實現了「十分之一數據,更優效果」的突破。

  在訓練上,TuringViT採用四階段漸進式原生動態分辨率訓練範式,從預訓練之初就適配下游任務的輸入特性,徹底告別了「固定分辨率預訓練+事後適配」的傳統模式,大幅降低了集成適配成本。

  賦能三大業務,築牢技術閉環

  隨着TuringViT的發布,小鵬集團在物理AI領域的底層技術能力進一步完善,並將全面賦能其三大核心業務。

  在智能駕駛領域,TuringViT作為第二代VLA模型的核心視覺編碼器,其近線性的延遲特性使得高分辨率視覺感知得以在車端算力約束下穩定運行,將助力窄路通行、複雜路口處理等功能的體驗升級。

  在智能座艙領域,其VLM(視覺語言模型)原生特性讓視覺特徵與語言模型實現更高效地對齊,可支撐更豐富的座艙交互功能。

  在人形機器人領域,TuringViT將充當IRON機器人的「視覺視網膜」,為其提供物體識別、空間關係理解等基礎感知能力。統一的基座架構也讓智能駕駛場景積累的視覺經驗能夠快速遷移至機器人場景,加速其落地進程。

  開放技術路徑,促進行業發展

  小鵬集團表示,TuringViT的價值不僅在於內部業務的落地,更在於為行業提供了一套可復現、可遷移的SOTA級(State-of-the-Art,最新技術水平)視覺大模型訓練方法論。

  其核心架構設計、數據治理流程與訓練範式均不依賴特定硬件平台,有望降低高性能視覺編碼器的訓練與定製門檻,使更多團隊能夠在可控算力條件下構建面向自身業務的視覺基礎模型,從而推動整個AI產業的技術進步與應用普及。

(文章來源:廣州日報新花城)

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10