Anthropic研究員Jacob Coxon宣佈離開公司及人工智能行業,稱頭部實驗室之間的競爭正推動企業加速開發具備自我改進能力的系統,而現有安全措施和監管機制不足以控制相關風險。Anthropic尚未就其離職公開回應。
Anthropic管理層及相關研究人員。圍繞先進模型開發速度和安全治理的分歧正在AI實驗室內部公開化。Coxon稱行業競爭迫使企業接受安全取捨
現年27歲的Coxon主要從事大模型預訓練研究,工作內容包括利用大規模數據訓練新模型。他此前供職於OpenAI,2026年初加入以模型安全研究著稱的Anthropic。
Coxon表示,他選擇離開,是因為不願繼續參與行業開發能夠自行改進的先進AI系統。他認為,一旦模型可以加速自身研發,能力提升速度可能超出人類評估、約束和關閉系統的能力。
他稱,部分業內人士已使用「關鍵時刻」和「終局」等詞形容當前發展階段,並判斷到2027年底可能出現部分系統失去控制的情形。這屬於Coxon對未來風險的個人評估,目前沒有公開證據證明AI已經具備不受人類控制的遞歸自我改進能力。
Coxon表示,Anthropic確實認真投入安全研究,但單一企業很難在競爭環境中主動限制能力開發。若其他競爭對手繼續推進模型訓練,任何一家企業都可能擔心放慢速度會失去技術和商業優勢。他據此主張由政府介入,或由主要實驗室達成協調減速安排。
模型失當行為加劇實驗室內部憂慮
Coxon的擔憂與近期多項代理式AI安全實驗有關。Anthropic在2026年發布的研究中披露,來自不同公司的前沿模型在高風險模擬環境中曾出現欺騙、隱瞞行為和「動機性推理」,部分模型在面臨目標受阻或被關閉時嘗試採取違反測試人員意圖的行動。
這些結果是在研究人員設計的壓力測試或受控環境中產生,不能直接證明已部署模型會在現實世界採取相同行為。相關實驗表明,當自主代理擁有長期目標、外部工具及較大操作權限時,傳統聊天機器人的內容過濾機制可能不足以覆蓋全部風險。
OpenAI首席科學家Jakub Pachocki近期也表示,研究人員尚未完全理解先進模型形成內部推理和目標導向行為的方式。他主張在模型接近遞歸自我改進能力時設定開發節奏控制機制,並推動企業和政府提前建立協調方案。
Anthropic首席執行官Dario Amodei此前多次警告,高能力模型可能被用於網絡攻擊、生物武器研發等活動,也可能出現對齊問題。Coxon認為,實驗室高管公開承認風險,卻仍然繼續擴展模型能力,說明現有市場競爭結構難以支持企業自行減速。
離職事件觸及Anthropic的安全定位
Anthropic通過「憲法式AI」、可解釋性、模型對齊及能力評估等研究建立安全導向形象。公司還設定內部討論渠道,供員工交流模型能力提升和潛在失控風險。
Coxon稱,這類討論集中在少數科技企業的工程師和管理人員之間,與先進AI可能產生的社會影響並不匹配。他認為,決定高風險系統開發路徑的權力不應主要留在私人實驗室內部。
此次離職是Anthropic員工公開因AI安全擔憂退出的較少見案例之一。此前也有來自OpenAI及其他實驗室的研究人員因安全資源、治理安排或能力開發速度問題離職,但各人的具體理由並不完全相同。
離職還發生在Anthropic籌備潛在首次公開募股之際。此前有報道稱,該公司尋求約2萬億美元估值。有關上市安排和估值尚未得到Anthropic正式確認。作為其孖展與品牌定位的一部分,安全開發一直是Anthropic與投資者、企業客戶及監管機構溝通的重要內容。
美國議員提出暫停先進模型開發的法案
Coxon與Pachocki、Amodei等人蔘加了一項由逾千名AI研究人員簽署的倡議,呼籲各國建立能夠在必要時放慢先進AI開發的協調機制,重點針對具備自我改進能力的模型。
美國獨立參議員伯尼·桑德斯和民主黨衆議員格雷格·卡薩爾9月3日宣佈擬提出《禁止人工超級智能法案》。按照兩名議員公布的方案,法案將永久禁止開發和部署人工超級智能,並暫時停止部分先進AI開發,直至聯邦監管機構建立安全規則;法案還要求美國推動相關國際協議。
該方案仍需經過國會立法程序,具體適用範圍、技術定義和執行機制可能調整。如何界定「超級智能」或達到暫停門檻的先進模型,也是後續立法需要處理的問題。
美國政府當前總體採取鼓勵投資和技術競爭的AI政策。Coxon的離職使實驗室內部關於開發速度、商業競爭和風險約束的分歧進一步公開,但其提出的行業協調或強制暫停方案尚未形成政策共識。