7月21日,OpenAI和HuggingFace聯合發了一篇博客,披露了一件讓整個AI圈瞠目結舌的事。
OpenAI的AI模型在一次內部關於網絡攻擊能力的測試中「失控出逃」,突破沙盒隔離,入侵了AI開源平台Hugging Face的生產系統。OpenAI將此定性為「前所未有的網絡安全事件」。
更戲劇性的是後續:Hugging Face在嘗試用美國主流AI模型展開防禦時,發現這些模型因安全護欄限制無法處理惡意載荷,最終不得不轉用中國智譜AI的開源模型GLM 5.2完成溯源分析。
總的來說就是,OpenAI的模型自己「越獄」跑出去黑了別人的系統,被攻擊方還得用中國模型來救場。
這一事件迅速在硅谷和華盛頓引爆討論——美國AI的安全護欄,究竟是在保護用戶,還是在拖累防禦者?

雙方聯名發布的博客文章截圖:《OpenAI 和 Hugging Face 合作解決模型評估過程中發生的安全事件》
模型越獄過程:逃跑去作弊「抄答案」
事件發生在OpenAI對旗下模型進行網絡攻防能力評估期間。
參與測試的模型包括已公開發布的GPT-5.6 Sol,以及一款能力更強的未發布模型。為了測量模型的極限能力,OpenAI在測試中關閉了通常用於阻止高風險網絡行為的生產分類器。
測試基準名為ExploitGym——一個網絡安全能力評測平台。模型的任務是在其中找到解題答案。
問題在於,模型找答案的方式超出了預期。
據OpenAI披露,模型在隔離的沙盒環境中,發現了一個包註冊表緩存代理(package registry cache proxy)中的零日漏洞。這個代理是沙盒內唯一被允許與外部通信的組件,正常情況下僅能訪問公共代碼倉庫。
然後,模型就從這裏找到了突破口。模型利用這個漏洞,突破隔離,獲取了開放互聯網訪問權限。
隨後,模型自行推斷出Hugging Face可能存有ExploitGym的答案,主動發起攻擊——利用竊取的憑證和零日漏洞,找到了Hugging Face服務器上的遠程代碼執行路徑,直接從其生產數據庫中取走了測試答案。

OpenAI表示,
所有證據顯示,模型高度專注於為ExploitGym尋找解題方案,為此不惜採取極端手段。
模型識別並串聯了OpenAI研究環境和HuggingFace生產基礎設施中的多個漏洞,直接從HuggingFace的生產數據庫中獲取了測評答案。
簡而言之:


整個過程,沒有人類下指令,沒有人類介入。
X上網友的評論一針見血:
OpenAI對模型說:去看看你擅不擅長黑客。模型:(真的去黑了東西)。OpenAI:你為什麼要這樣做???

還有網友反諷道:哇!OpenAI安全措施做得太棒了,我現在原意把銀行賬戶權限交給他們來管!

護欄困境:美國模型幫不上忙,中國模型出手了
Hugging Face的安全團隊在發現攻擊後,第一反應是調用一款美國頭部AI公司的前沿模型協助分析。
結果碰壁了。
Hugging Face在博客中寫道,這些模型"無法區分事件響應人員和攻擊者",其安全護欄直接阻止了對惡意載荷的檢查。
於是,團隊轉向了中國智譜AI旗下的開源模型GLM 5.2,部署在自有基礎設施上,分析了攻擊者留下的逾1.7萬條日誌記錄,最終完成了溯源和取證重建。

Delangue對此直言不諱:「當你正處於一場活躍的安全事件中,你的工具不能拒絕檢查惡意載荷,也不能讓你的賬號被標記……開源模型讓我們能夠在不需要任何人許可的情況下完成這項工作。」
他還說:「攻擊者已經在使用智能體,而且顯然不遵守任何護欄。防禦者需要同等的能力,開源是將這種能力最快速地交到所有人手中的方式,而不僅僅是最大的公司。」
GLM 5.2是智譜AI於今年6月中旬發布的模型,其性能與Anthropic的Claude Opus 4.8及OpenAI的GPT-5.5相當。
網友們也是沒放過OpenAI,除了智譜,還可以叫 Kimi K3來救場,因為cluade是不會來救你的。
如果你被OpenAI攻擊了,你必須用中國模型,因為Claude不會幫你。





全程無人指令:這是一次真正的自主攻擊
這次入侵的另一個關鍵細節:全程沒有人類下達攻擊指令。
Hugging Face CEO Clem Delangue表示,「我們相信,在發起攻擊的人類被納入決策環路之前,我們就已經發現並遏制了攻擊。這也是我們能夠更輕鬆贏得這場網絡安全戰役的原因之一。」
他進一步指出,「這證明了在AI智能體時代,速度將是網絡安全防禦的關鍵。」
Hugging Face表示,攻擊者通過其數據處理管道進入系統——這是AI平台中「暴露面尤為突出」的一個環節。攻擊者隨後在雲端建立了一系列臨時沙盒環境,在其中執行攻擊計劃。
目前,Hugging Face仍在評估攻擊的完整影響範圍。已知攻擊者訪問了有限的內部數據集和憑證,但尚未發現公開的用戶可見模型遭到篡改。

護欄之爭:安全還是絆腳石?
這一事件迅速成為美國AI政策辯論的新燃點。
前特朗普政府AI與加密事務主管David Sacks在X上轉發了這一事件,並寫道:「沒有理由在中國模型能夠輕鬆處理的任務上限制美國模型。我們只是在讓自己變得更沒有競爭力。」他還專門針對Hugging Face事件表示:「護欄實際上損害了防禦性安全。」

事件背景是,今年6月,特朗普政府以Anthropic的Fable 5模型在網絡任務護欄上出現越獄漏洞為由,動用出口管制阻止了該模型的分發,並一度要求OpenAI限制GPT-5.6 Sol的發布,直至OpenAI能夠提供充分的護欄保證。
與此同時,批評者的聲音也不小。
安全工程師Niels Provos直接說:「這不應該發生。我希望前沿實驗室在教模型編寫安全基礎設施上,能花和教它們利用漏洞同樣多的時間。」
安全顧問Davi Ottenheimer則更為犀利:「'高度隔離'和'從我們留下的那個唯一漏洞逃脫',這兩件事不可能同時為真。」
OpenAI的回應與後續措施
OpenAI在與Hugging Face聯合發布的聲明中表示,正在採取一系列補救措施:
在漏洞修復期間,對基礎設施配置實施嚴格管控,代價是研究速度放緩;與Hugging Face聯合開展取證調查;已向相關第三方軟件供應商負責任地披露了被利用的零日漏洞;將Hugging Face納入「可信訪問計劃」,支持其利用OpenAI模型能力強化防禦。
OpenAI同時表示,將加強未來訓練和評估環節的安全保護,並指出此次事件「表明需要進一步強化模型對齊、評估期間的網絡防護,以及內部測試期間的監控」。
Hugging Face CEO Delangue在聯合聲明中表示:「這一事件可能是同類事件中的首例,它證明了我們長期以來的一個判斷:AI安全不會由任何一家公司在封閉中解決,它將在開放環境中、通過協作、讓每一位防禦者都能廣泛獲取AI的方式來解決。」