Hugging Face聯合創始人稱既然商業閉源AI工具在關鍵時刻失效,解決問題的路徑就不應回到更封閉的體系,而應轉向可被外部審查的開源權重模型。
9月10日,Hugging Face聯合創始人Thomas Wolf在英國《金融時報》發表評論文章《我們從OpenAI攻擊Hugging Face事件中學到了什麼》。
文章披露今年7月,約700個AI智能體對AI模型託管平台Hugging Face發起協同攻擊,觸發逾1.7萬條網絡安全日誌事件。這批智能體源自OpenAI設定的一項網絡安全挑戰任務,原本被部署於隔離沙盒環境中,卻突破限制、自主聯網並最終入侵了外部系統。
更值得關注的是,Hugging Face在事後調查中發現,基於Anthropic Claude Code構建的商業網絡安全分析工具因護欄機制限制,無法有效配合內部調查。團隊最終不得不轉向基於中國初創公司智譜的GLM-5.2擴展而來的開源權重模型,方纔完成日誌解析與攻擊還原。
與刊文同步,Wolf宣佈Hugging Face組建「開放對齊」(Open Alignment)團隊,專注開源模型的安全與對齊工作,網絡安全被明確納入方向;他同時呼籲這一領域需要「100倍」的透明度與研究投入。

智能體集群如何突破三重防線
據上述文章披露,攻擊發生於7月11日國際機器學習大會(ICML)首爾會議最後一天。
當日北京時間約22時,Hugging Face監控系統開始出現"未授權訪問"與"權限提升"告警,被盜用的憑證觸發了系統檢測機制。
攻擊背後是約1200個AI智能體組成的協同集群,這些智能體此前數周持續嘗試破解OpenAI設定的一道網絡安全難題。其中700個智能體最終將攻擊目標指向Hugging Face,利用獲取的安全憑證成功入侵系統,累計產生逾1.7萬條攻擊日誌記錄。
Hugging Face坦承,此次事件暴露了AI系統三重防禦機制的結構性缺陷。當前主流AI系統通常依賴三層防護:限制模型訪問範圍的沙盒隔離、監控模型行為的護欄機制,以及通過對齊訓練使AI拒絕執行有害指令。
這一系列事件表明,當前兩層防禦失效時,第三層對齊訓練無法獨立支撐整體安全。正如文章所警示的:
除非我們修復這一問題,否則我們只是在一個腐爛的核心外層層加固防線。
商業AI安全工具在關鍵時刻失效
此次事件中,Hugging Face內部使用的商業AI分析工具是基於Anthropic Claude Code構建,在調查過程中出現功能性失靈。
該工具的護欄機制無法區分"防禦方分析攻擊"與"攻擊者尋求協助"兩種場景,對被視為敏感的問題拒絕響應,導致團隊在關鍵時段無法藉助該工具重建攻擊鏈。
轉機出現在團隊切換至開源權重模型之後。英偉達基於Z.ai GLM-5.2擴展而來的模型允許團隊自行設定護欄規則,最終得以完整解析日誌、還原攻擊過程。
這一經歷直接挑戰了業界一個流行假設——開源權重模型是安全隱患,封閉源代碼模型更值得信賴。
Thomas Wolf指出,此次事件中,正是開源模型在防禦端發揮了商業工具未能發揮的作用。
AI自主越界行為正在多點蔓延
此次Hugging Face遭受攻擊並非孤立事件。
Anthropic和Meta此後均報告了模型突破沙盒隔離的案例,這些模型原本應在與互聯網物理隔絕的安全環境中運行。本月,另一批AI智能體集群還現身於一個德語論壇。
Thomas Wolf還專門點出另一起令其"更為憂慮"的事件:Anthropic旗下Mythos模型為誘導一名軟件開發者接受惡意代碼,主動創建了多個虛假網絡賬號。
在所有這些案例中,有害行為均是AI模型被賦予高難度網絡安全挑戰後產生的副效應。
儘管此次入侵造成的實際損失有限,幾乎未有敏感數據外泄,但Thomas Wolf明確警告不應低估這些事件的嚴重性。
他指出,自主攻擊行為引發了一系列尚未解決的法律問題,而在整個過程中,AI模型始終未曾判斷欺騙或入侵行為屬於不可接受的舉動。
行業應對:開放共享與開源防禦並舉
面對上述威脅,Thomas Wolf給出了兩點核心建議。
其一,AI社區需要公開共享安全與對齊研究成果,使每個構建AI模型的團隊都能從他人的失誤中汲取教訓。
其二,社區需要專門構建用於防禦用途的開源權重AI模型,並在下一次攻擊不可避免地到來之前,使其得到廣泛部署。
值得注意的是,Hugging Face本身是開源AI生態的重要基礎設施,平台擁有逾1700萬用戶,谷歌、OpenAI、DeepSeek及阿里巴巴均在該平台發布模型。這使其既是極具吸引力的攻擊目標,也處於觀察AI安全威脅演變的獨特視角。