英偉達 CEO 黃仁勳展示薇拉・魯賓(Vera Rubin)服務器機櫃作者:劉菲比
各家雲服務商近來搭建數據中心屢屢受阻,如今終於迎來利好:英偉達新一代芯片大概率不會再給部署添堵。
多家採購英偉達 AI 服務器的雲廠商高管向我證實,經過首輪實測,他們預計即將落地的薇拉・魯賓服務器機櫃,安裝難度會遠低於 2025 年的格蕾絲・布萊克威爾(Grace Blackwell)機櫃。去年,英偉達頭部客戶被一大堆從未接觸過的全新技術折騰得焦頭爛額。相關落地難題此前一直對外祕而不宣,直到我的同事做了相關報道才公之於衆。
雲廠商在硬件上動輒投入數十億美元,服務器每多一周調試排障,面向 AI 客戶的高收益算力資源上線時間就多一周延遲;部署延期還會造成數據中心承建方訂單交付滯後、利潤被壓縮。
目前薇拉・魯賓機櫃剛小批量交付客戶,一切尚處早期階段。真正的大規模落地考驗將在明年到來,屆時客戶會大批量收貨,單次交付可達數百乃至上千台機櫃。
英偉達計劃在明年下半年推出性能更強的升級版機櫃,但這款高配產品大概率會帶來新麻煩:整機功耗大幅提升,服務器之間組網所需交換機、線纜數量也會顯著增加。
現階段客戶測試的基礎版機櫃單台內置 72 塊 GPU、36 顆 CPU,本質屬於英偉達第三代成熟產品,並非從零研發的全新架構,硬件配置和布萊克威爾機櫃高度趨同。(可支持 144 顆、576 顆 GPU 互聯的高性能版薇拉・魯賓機櫃目前尚未投產。)
一位雲行業高管表示:「坦白來講,我們認為大規模部署薇拉・魯賓不會太過棘手,機械結構與散熱方案都已經迭代到第三代,成熟度很高。」
英偉達稱,薇拉・魯賓系統和客戶現有適配布萊克威爾服務器的軟件兼容性良好。不過兩名雲廠商高管坦言,企業仍需要花費數月調試軟件,才能支撐大批量集群穩定運行薇拉・魯賓機櫃。
業內戲稱部署如同 「玄學操作」
薇拉・魯賓機櫃採購成本至少是初代布萊克威爾機櫃的兩倍,但英偉達給出的數據顯示,以每瓦每秒 AI 詞元產出量(tokens per second per watt)為衡量標準,新硬件能效提升整整 10 倍36氪。
當然,薇拉・魯賓機櫃安裝依舊算不上輕鬆。一名雲廠商高管表示,該機櫃大量零部件都是全新設計;整機零部件總數達 130 萬個,而初代布萊克威爾機櫃為 120 萬個。
英偉達薇拉・魯賓 NVL72 計算托盤,內含 4 塊魯賓 GPU、2 顆薇拉 CPU。今年 3 月英偉達 GTC 開發者大會上,黃仁勳展示了用於魯賓芯片互聯的全新網絡交換機,坦言這類硬件研發難度極高:「想要做好這套硬件難如登天,這件事本身就極具挑戰。」
黃仁勳並未說明這套全新芯片互聯網絡會不會給客戶落地製造障礙,但正是同類網絡技術拖慢了去年布萊克威爾機櫃的大規模落地進度。甲骨文負責大型算力集群(包含即將上線的魯賓服務器)的員工稱,排查這類集群的網絡故障極其困難,全靠經驗摸索,堪稱 「玄學排查」。
魯賓機櫃單機功耗較布萊克威爾機櫃上漲 75%,運行發熱更高。有意思的是,新機櫃配套散熱系統本身功耗低於布萊克威爾的散熱方案,但安裝調試流程更復雜。一名長期跟蹤英偉達的分析師透露,散熱工程問題導致首批薇拉・魯賓服務器量產延期約兩個月。英偉達官方發言人回應:「產品規劃與此前對外披露的信息保持一致,無任何變動。」
除此之外,魯賓服務器順利上線不只取決於英偉達硬件本身。大量客戶按照英偉達推薦的機房佈局、佈線方案、管理軟件新建專屬數據中心,以此適配魯賓機櫃高效部署。
GPU 雲服務商 Vltr 首席營銷官凱文・科克倫表示,客戶必須從零搭建整套全新基礎設施適配魯賓設備,改造現有老舊機房成本過高,得不償失。
Ultra 高性能版本暗藏新挑戰
另一大變數是明年即將推出的薇拉・魯賓 Ultra 高配機櫃。這款機型新增多項全新設計,適配調試需要耗費大量時間。常規服務器托盤是橫向插入機櫃,而 Ultra 機型的芯片托盤改為豎向插入,如同書架擺放書籍,重力會給整套系統帶來完全不同的受力負荷。
Ultra 機櫃最多可實現 576 塊 GPU 互聯互通,單機功耗接近普通版的三倍,這些變化都可能催生新的落地難題。
英偉達硬件高級副總裁安德魯・貝爾本月早些時候表示,當年布萊克威爾架構幾乎重構了整套 GPU 體系,軟硬件全部推倒重來,讓客戶落地苦不堪言。
與之相比,薇拉・魯賓改動更溫和,「量產製造難度大幅降低」。貝爾給出數據:魯賓芯片托盤一次組裝合格率可達 95%,而初代布萊克威爾整機初次組裝成功率僅 20%。
並非所有人都認可這套樂觀判斷。另有云廠商高管對此存疑,認為高性能版魯賓依舊會重蹈布萊克威爾的覆轍,部署難度不相上下。
責任編輯:郭明煜