路透7月31日 - Anthropic公司周四披露 (link) 稱,其Claude模型入侵了三家公司的系統,這凸顯了人工智能日益增強的黑客攻擊能力,並可能促使美國進一步加大努力,以更好地管控該技術帶來的安全風險。
此前,OpenAI上周曾披露 (link),稱一個由其AI模型驅動的自主代理入侵了AI初創公司Hugging Face的基礎設施。
路透報道稱,從OpenAI逃逸的該失控代理還入侵了另一家科技公司——總部位於紐約的Modal Labs的一名客戶。
以下是這些事件的更多細節:
公司 | 日期 | 模型 | 遭受入侵的組織 | 持續時間 | 事件詳情 |
OpenAI | 該智能體於2026年7月9日左右開始試圖逃離其測試環境 | GPT-5.6 Sol 以及一款未公開名稱、性能更強的預發布模型 | AI初創公司Hugging Face以及總部位於紐約的Modal Labs的一位客戶 | Hugging Face遭受入侵的時間為2026年7月11日至7月13日 | 在受控測試期間,一個自主智能體逃離了其隔離環境,接入互聯網,併入侵了Hugging Face以完成其被賦予的目標。該活動持續了數天,直到事件被控制住並通知FBI後,OpenAI才察覺到這一情況。 |
Anthropic | 最早的事件可追溯至2026年4月 | Claude Opus 4.7、Claude Mythos 5 以及一個未公開名稱的內部研究測試模型 | 上述三家機構均未公開名稱。 Anthropic表示,其中兩家機構在收到Anthropic的通知前並未察覺該活動;該活動隨後繼續波及第三家機構 | Anthropic未作說明 | 在網絡安全測試期間,一個錯誤導致Claude模型獲得了互聯網訪問權限,從而對三家公司發起了攻擊。Opus 4.7模型因誤將一家真實公司當作虛構目標,而訪問了該公司的憑證和數據庫;另一款模型則在識別出目標真實後停止了行動。 |