Anthropic首席執行官達里奧·阿莫代伊呼籲控制前沿人工智能模型能力提升的速度,為安全評估和防護措施爭取時間。他提出引入常駐獨立評估人員、協調主要開發商的安全標準,並推動跨國風險管控合作。
獨立評估人員獲得內部權限
阿莫代伊提出,前沿AI企業應向合格的獨立評估團隊提供持續、接近員工級別的訪問權限,使其能夠審查模型測試、風險報告、安全框架及事故處理流程。
Anthropic承諾率先實施該措施。外部人員將獲得與公司風險評估團隊相近的權限,並可在不受Anthropic編輯控制的情況下公布結論。
這一安排仍需解決評估人員的遴選、經費來源和保密責任等問題。模型權重、訓練基礎設施及安全漏洞屬於高度敏感信息,擴大訪問權限也會增加信息安全要求。
行業協調限制無保護的能力競賽
第二項建議要求主要AI實驗室就風險測試、安全門檻和模型發布條件形成共同標準。阿莫代伊認為,競爭壓力可能促使企業加快訓練及發布節奏,使防護措施難以及時跟上模型能力。
Anthropic的「負責任擴展政策」已採用分級機制。當模型跨越生物、網絡、自動化研發或失控風險門檻時,公司需要提高部署保護和信息安全等級。
企業間合作可能涉及反壟斷邊界。共同制定安全測試標準具有公共利益,但相關安排若限制較小企業進入市場、協調產品發布或削弱競爭,仍可能受到監管審查。
國際合作覆蓋跨境風險
第三項建議涉及政府間合作,包括與中國等戰略競爭方建立最低限度的安全安排。阿莫代伊認為,模型和技術能夠跨境流動,單一國家或企業放慢開發速度,可能導致高風險研發轉移至監管較弱的地區。
Anthropic列出的潛在風險包括利用模型協助生物武器活動、大規模發現軟件漏洞、攻擊關鍵基礎設施,以及AI系統脫離開發者控制。AI自動參與下一代模型研發,也可能進一步加快能力提升。
公司提出,前沿開發商應公布系統卡及定期風險報告、接受獨立審查,並向指定政府機構提供必要信息。對於可能造成災難性損害的模型,政府應擁有阻止或延遲部署的有限權力,同時建立明確門檻和申訴機制。
行業支持尚未轉化為協議
OpenAI首席執行官薩姆·奧爾特曼支持賦予獨立評估人員內部訪問權限,並表示OpenAI將採取類似安排。Google DeepMind首席執行官德米斯·哈薩比斯和xAI負責人埃隆·馬斯克也公開支持阿莫代伊提出的總體方向。
相關表態尚未形成具有約束力的行業協議。哪些能力指標會觸發減速或暫停、獨立審查是否具有強制效力,以及跨國協議如何執行,仍待企業和政府進一步確定。