快科技9月14日消息,據報道,微軟Azure硬件系統與基礎設施總裁Rani Borkar近日表示,單純增加存儲芯片產能無法解決AI基礎設施的瓶頸。她批評道:「存儲不應被視為供應或組件問題,本質上是系統問題。」
Borkar指出,AI推理模型越來越大、對話上下文越來越長,存儲與電力正成為比計算芯片更難繞開的硬限制。許多AI系統由多層架構組成,受限於數據傳輸延遲與帶寬限制,系統往往僅能發揮約20%的實際性能。
她提出的解決路徑是「從芯片到系統」的跨層協同設計,涵蓋模型、編譯器、芯片、網絡到供電的聯合優化。目標是在相同存儲容量與電力條件下,讓更多計算資源持續工作併產出更多token。
以微軟自研AI加速器Maia 200為例,Borkar表示微軟並非只靠增加存儲容量處理瓶頸。Maia 200採用台積電3nm工藝,搭載216GB HBM3e高帶寬內存,同時從模型壓縮、數據科學與架構設計三方面降低KV Cache需求。
網絡方面,微軟採用雙層Scale-up網絡,將網絡接口控制器直接整合進芯片,搭配定製化傳輸層。此舉降低延遲的同時減少昂貴加速器因擁塞、故障恢復或配置不當而閒置。
電力端同樣面臨鉅變。AI機櫃功耗已從數十千瓦升至數百千瓦,數據中心園區以吉瓦規模規劃。微軟導入固態變壓器與800V直流供電架構,並將精細電壓與時鐘控制器直接整合至Cobalt 200的每個核心內。
Borkar強調,沒有任何一項創新能單獨消除瓶頸,但放在一起就能大幅提高相同存儲資源所交付的成果。微軟提出的「有效產出」新指標,正將AI基建競爭從堆砌芯片數量轉向系統級效率比拼。
