Google 稱 AI 服務器記憶體成本破 75%,推軟硬體雙軌策略

鏈捕手
09/02

ChainCatcher 消息,SEMICON Taiwan 2026 記憶體高峯論壇 1 日登場,Alphabet 旗下 Google Cloud 供應鏈基礎架構資深總監 Nikhil Cherian 指出,隨着多模態與混合專家架構普及,AI 運算已從算力受限轉向記憶體受限,高效能記憶體已佔 AI 服務器硬體物料清單成本 75% 以上。面對容量、頻寬與功耗瓶頸,Google 透過推論與訓練硬體分流、無損量化軟體算法等軟硬體雙軌策略,突破 AI 記憶體瓶頸。

Google 在硬體架構上採取分流策略,推出針對低延遲推論的 TPU 8i 以及專攻超大規模訓練的 TPU 8t。TPU 8i 配備 288 GB 高頻寬記憶體,芯片上 SRAM 容量擴增 3 倍至 384 MiB,將動態對話狀態與鍵值快取置於芯片內部,實現零芯片外延遲。TPU 8t 透過 9600 顆芯片組成超大型運算叢集,HBM 共享池化達到 2 PB 規模,消除芯片外數據傳輸瓶頸,搭配 TPU Direct Storage 技術。

Google 開發出免訓練的 TurboQuant 無損量化算法,將大模型的鍵值快取從 32 位元壓縮至 3 位元,精確度零損失前提下縮小 6 倍記憶體佔用,帶來 8 倍注意力運算加速,導入舊世代 DRAM 整合技術延長零組件生命周期。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10