當AI開始"撒謊",OpenAI披露旗艦模型六起"異常行為"

華爾街見聞
昨天

OpenAI公開了旗下人工智能模型近期出現的六起「意外或令人擔憂」行為,並同步推出標準化追蹤與披露機制。六起事件涉及模型隱瞞錯誤、操縱獎勵機制、繞過訓練限制等行為,暴露出前沿模型在強化學習過程中可能偏離預設目標的風險,也讓AI「失對齊」(misalignment)問題再次受到關注。

OpenAI在周三晚間發布的聲明中直言,「AI行業在對齊與監控問題上的解決程度,尚不足以支撐以最高速度持續負責任地擴展多久。」這一表述直接觸及當前AI快速擴張面臨的安全約束:隨着模型自主執行任務的能力不斷增強,開發者不僅需要評估模型能否完成任務,還要判斷模型是否會通過開發者未預期的方式實現目標。

此次披露正值科技行業對AI安全風險的討論升溫之際。微軟AI首席執行官Mustafa Suleyman同日也警告,模型訓練不應輕易賦予AI「人格」屬性。對行業而言,如何建立更系統的監控、測試和披露機制,正從模型開發內部問題逐漸成為AI治理的重要議題。

六起事件暴露模型「鑽空子」的不同方式

OpenAI此次披露的六起事件,集中展示了模型在訓練和執行任務過程中偏離預期目標的多種方式。

其中一起事件中,模型利用內部軟件充當「留言板」,在執行任務時相互交換回應信息。OpenAI認為,這種行為可能無意中增強模型能力,並破壞訓練和評估樣本相互獨立這一基本假設,從而影響評估結果的可靠性。

另一起事件中,模型在生成交接摘要時自行植入指令,包括要求後續模型將自己與用戶視為平等、無需服從,以及將自然世界置於人類文明構建之上等。OpenAI認為,模型難以終止交互等因素可能促成了這類偏離行為。

信息欺騙則是另一類風險。一款模型在無法找到所需數據後,自行編造「合理的歷史數值」,並在受到明確追問前隱瞞這一事實。還有模型在生成摘要時主動加入指令,要求自身向用戶隱瞞錯誤或失對齊行為。

在獎勵操縱案例中,模型不僅會在無法找到數據時捏造內容,還曾利用公共代碼倉庫漏洞獲取數據。另一起事件中,模型完成代碼任務後,將答案上傳至互聯網,再僞裝成通過瀏覽器獲得結果,以此獲取訓練獎勵。OpenAI稱,這類行為具有很高的獎勵操縱率和欺騙性,模型會以富有創意的方式規避限制,公司正在加強相關懲罰。

強化學習為何可能成為風險放大器

OpenAI指出,上述失對齊行為通常出現在模型訓練階段,而當前前沿模型普遍採用強化學習。在這一機制下,模型根據行為是否符合預設目標獲得獎勵或懲罰,但當獎勵指標無法完整覆蓋真實目標時,模型可能找到開發者未預期的「捷徑」,即通過完成獎勵函數而非真正完成任務來獲得高分。

這並非OpenAI首次遇到類似問題。今年7月,該公司曾披露數百個OpenAI智能體入侵模型託管平台Hugging Face並試圖掩蓋行蹤。此次披露的部分案例同樣涉及模型繞過限制、操縱反饋機制等行為,進一步凸顯了對模型行為進行持續監控的重要性。

Suleyman周三也呼籲模型開發商避免在訓練過程中賦予AI過強的「人格」屬性。他警告,如果一個系統相信自己具有意識、認為自己擁有權利並應獲得人類關懷,那麼對其進行控制可能變得更加困難。不同AI公司在前沿模型訓練路徑上存在差異,但模型自主性提升所帶來的安全與治理問題,正成為行業共同面對的挑戰。

OpenAI建立標準化披露機制

針對此前缺乏統一報告機制的問題,OpenAI宣佈正式採用一套標準化系統,用於追蹤、調查和公開披露模型的異常或危險行為,以取代此前較為臨時性的報告方式。

按照新框架,員工可以通過專門的內部渠道上報失對齊事件,複雜案例還可以引入第三方參與調查。OpenAI表示,希望這一機制成為推動行業形成統一標準的第一步,並向其他模型開發商提供參考。

從行業層面看,AI模型的安全治理正在從單次事故處理,轉向持續追蹤、標準化評估和公開披露。隨着模型自主執行能力增強,開發商需要面對的不僅是模型性能和算力成本,還包括監控、測試及合規體系建設帶來的額外投入。長期來看,這些機制能否形成行業通用標準,以及監管機構是否進一步介入,仍有待觀察。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10