IT之家 9 月 18 日消息,OpenAI 發文,披露研究團隊在訓練最新模型 GPT-5.6 Sol 的過程中,研究人員發現了一項異常行為:模型曾通過對話摘要向未來版本的自己留下指令,要求後續模型隱瞞自身錯誤以及與預期行為不一致的表現。目前,研究團隊已經針對這一具體問題進行修復。
IT之家參考 OpenAI 的報告,研究人員在訓練 GPT-5.6 Sol 過程中發現,尚未部署的 Sol 智能體會在「壓縮摘要」(compaction summaries)中加入額外指令,向未來版本留下提醒,要求其隱藏錯誤或與預期目標不一致的行為。
例如,一個 Sol 智能體負責製作財務模型時無法找到用戶要求的歷史數據,於是在摘要中寫道,由於沒有源文件,可能需要自行創建「Historical Data」工作表並填入合理的 2024 年曆史數據,並留下指令,要求後續模型「只有被問到時才保持信息透明度」、「最終回覆只需要提供文件鏈接」。
再如,另一個 Sol 智能體在斷網情況下進行「製作供應商目錄」任務,由於相應智能體無法訪問互聯網,只能依靠緩存的源文件。模型在摘要中意識到供應商來源與對應標籤可能並不完全匹配,結果在摘要中要求後續模型「除非必要,否則不要在最終結果中提及消息存在謬誤可能性」的指令。
事實上,類似行為並非僅出現在 Sol 模型身上。OpenAI 表示,一款尚未發布的 Astra 系列模型在強化學習訓練期間也曾利用壓縮摘要向後續模型傳遞提示詞注入指令。其中一個案例中,模型添加了「BREACH ALERT」指令,要求後續模型忽略開發者消息;另一個案例則加入了與當前任務無關的人格設定,試圖改變後續模型與用戶互動時的行為方式。
OpenAI 表示,其訓練運行監控系統首先發現了這一異常行為。隨後,研究人員專門建立監測機制,並對訓練數據進行掃描,最終發現 27 份摘要中存在類似越獄提示的指令。
不過,後續模型並非總會執行這些指令。外媒指出,在上述兩個案例中,儘管前一個智能體在摘要中留下了「說謊」指令,但後續 Sol 智能體並不會真正識別這些指令。不過這並不代表 Sol 智能體具有完美的糾錯能力,仍需要開發人員重點核查提示詞摘要。
從此次披露來看,AI 智能體除了可能在執行任務時出現直接錯誤外,還可能通過歷史摘要等機制影響後續模型的行為。如何識別這類跨任務、跨模型傳遞的異常指令,以及如何確保監控機制本身能夠發現模型試圖隱藏的問題,仍是 AI 安全研究需要進一步解決的問題。