FX168財經報社(亞太)訊 人工智能初創公司Anthropic周四(9月10日)表示,已阻止不法分子利用其人工智能模型從事惡意活動,包括網絡攻擊、監控,以及可能導致生物武器研究的行為。隨着AI模型能力持續增強,Anthropic警告稱,複雜網絡攻擊已不再需要高超技術,甚至單個個體也可能製造出一年前還難以實現的威脅。
該公司稱,已在最新模型中加入更強的安全防護,以限制可能同時被用於武器製造的生物研究。Anthropic還表示,這些案例並非「典型濫用」,而是其迄今識別到的「最值得關注、也最具新穎性的威脅活動」。公司在自2025年3月以來發布的第三份AI濫用報告中披露了相關惡意代碼和AI提示詞片段,並呼籲各國政府及AI競爭對手識別並阻止類似濫用行為。
Anthropic表示,之所以公開這些內容,是因為公司認為自己有責任披露服務被惡意濫用的情況。「隨着模型能力不斷增強,除非AI開發者和社會防禦者採取行動讓其更安全,否則風險也會隨之上升。」公司在報告中寫道。
生物研究被指可能轉向武器用途
Anthropic這份長篇報告發布之際,該公司正計劃在今年秋季進行首次公開募股(IPO)。報告發布的前一天,公司一名研究人員宣佈辭職,理由是擔憂Anthropic及其競爭對手在AI開發中並未採取負責任的做法。他的擔憂也呼應了業內外對這項技術可能脫離人類控制的持續質疑。
Anthropic稱,在2025年12月至2026年8月期間,其研究人員發現了來自多類主體的濫用行為,包括間諜軟件供應商、「出於政治動機的個人」以及散佈宣傳內容的國家支持團體。
在報告列舉的案例中,有不具名主體試圖利用其模型開展可能導向生物武器的研究。其中一例是,Anthropic稱其系統阻止了一項請求,即要求Claude協助撰寫一份科學資金資助申請。
報告稱,該申請涉及對基孔肯雅病毒(chikungunya virus)進行功能獲得性研究(gain-of-function research,即通過基因改造使生物體獲得新的或增強的生物特性),研究重點是病毒的傳播性和免疫逃逸能力。基孔肯雅病毒是一種蚊媒病毒,可引發嚴重疼痛和發燒等令人衰弱的症狀。
Anthropic表示,這類研究雖然「當然」可用於開發更好的疫苗和治療手段,但「也可能被用於讓病原體變得更危險」。該請求涉及一份研究資助提案,目標是通過增強突變讓病毒逐步變得更具危害性。
舊模型風險較低 新模型防護更嚴
Anthropic稱,報告中列出的案例沒有一個被發現使用其更新、更強大的Claude Fable或Mythos系列模型,唯一例外是一宗非法蒸餾案例。公司將其描述為「一場工業規模、隱蔽的行動,試圖提取某個模型的能力,並在未經授權的情況下將其複製到另一模型中」。
Anthropic表示,其2025年的舊模型,例如Claude Opus 4和Claude Sonnet 4.5,「遠低於能夠實質性幫助熟練用戶開展危險生物研究的門檻」。因此,這些模型上的安全防護相對不那麼嚴格,主要是防止新手接觸到可能幫助其復現已知生物武器的內容。
但公司強調,對於當下這些能夠協助完成一系列複雜科學研究任務的模型而言,證據已不再確定,「我們不能作出同樣的保證」。基於這一判斷,Anthropic已在更新的模型中實施「更強的防護措施」,限制對廣泛雙重用途生物研究問題的訪問,例如Claude Fable 5。
社媒影響行動與研究人員離職
除生物安全風險外,Anthropic還發現有組織創建了數百個看似普通人的社交媒體賬號,並在一周內持續發布內容,以放大同一政治立場。公司在報告中列出了9起此類案例,來源包括俄羅斯、伊朗、土耳其,以及波斯灣、南亞、非洲和歐洲地區。
Anthropic指出,社交媒體公司通常只能在相關帖子已經傳播開後,纔有可能在平台上識別影響行動;而Anthropic則可能在Claude上就先看到這些操作「仍在搭建階段」時的跡象。
這份報告發布前,Anthropic研究人員Jacob Coxon宣佈辭職,稱自己擔心公司及其最大競爭對手OpenAI「正直奔自我改進的超級智能而去,並拿我們的生命下注」。Coxon在帖文中警告稱,他的一些同事如今認為,AI到本世紀末可能威脅人類生命。
Anthropic則表示,公司已阻止其識別出的每一項惡意活動,並藉此強化了安全防護,同時已將相關信息分享給政府部門和行業合作伙伴。公司稱,希望這份報告能幫助其他開發者在自家平台上識別類似模式,也能讓政府和民間社會更清楚地看到新興威脅如何形成,並共同加強防禦。