路透9月18日 - 人工智能實驗室Anthropic周五表示,將與埃森哲 ACN.N 合作,對其前沿人工智能模型進行獨立評估,雙方均承諾在未來五年內各投入至少10億美元,以建設相關工作能力。
此次合作正值人工智能開發商面臨來自監管機構、企業和研究人員的日益增大壓力,要求其確保先進模型的安全性和可靠性。
近期發生 的多起事件——包括AI代理從受保護的環境中「逃逸」——引發了人們的 擔憂,即AI最終可能在人類干預有限的情況下自主發展,使其行為更難被監控和控制。
周六,Anthropic首席執行官達里奧·阿莫德伊(Dario Amodei)呼籲 (link) 人工智能公司放緩前沿模型的開發,並允許獨立評估人員更廣泛地訪問其系統。
競爭對手OpenAI周三表示,將開始發布(link)關於模型意外或令人擔憂行為的定期報告,同時公布了六份關於此類事件的報告。
埃森哲(Accenture)旗下的AI專業業務部門Faculty將牽頭此次合作, 對該AI實驗室的模型進行評估和紅隊測試,開展對齊評估並測試模型安全防護措施。
雙方的投資將支持Anthropic所稱的「嵌入式評估」,即獨立評估人員在AI公司內部工作,其訪問權限與員工相當。
「從這一獨特視角出發,嵌入式評估人員可以評估公司的運營情況,覈實其是否履行了安全承諾,並發現潛在盲點,」Anthropic表示。
該公司補充道,評估人員還可以報告事件,並向公衆提供關於人工智能益處與風險的更全面信息。
Anthropic和埃森哲計劃以類似的方式與其他評估人員和AI開發商合作。