
周二,OpenAI宣佈了一系列新的安全政策,重點加強模型測試期間的安全事件管控。新措施包括在開發過程中對模型進行更詳細的監控,以及在訓練後階段更強調對齊與安全。
「隨着模型能力不斷增強,內部開發和測試過程中所伴隨的風險也在上升,」該公司在一篇博客文章中表示。「我們的監控、對齊和安全標準必須保持在這些風險之前。」
這是自7月21日Hugging Face事件披露以來,OpenAI安全實踐方面首批公開的變動之一。
OpenAI代表表示,這些措施並非直接針對Hugging Face事件,但在一定程度上也受到即將推出的Astra模型網絡安全能力以及AI發展整體步伐的推動。
在同一篇博文中,OpenAI透露,在Hugging Face事件後其暫停了為期兩周的強化學習(RL)訓練,但此後已重啓了多數風險較低的模型。
「我們最大規模的計劃前沿強化學習運行仍處於暫停狀態,同時我們正進行較小規模的訓練和評估,以觀察模型行為、驗證我們的安全措施,並在推進前建立更多對齊方面的證據,」博文寫道。
OpenAI研究副總裁Amelia Glaese對記者表示,隨着模型能力增強,管控的嚴格程度也將相應提高,最大的模型將面臨最嚴格的審查。
「我們已經為安全開發制定了要求和預期,」Glaese告訴記者。「這些要求和預期會根據我們觀察到的風險水平而變化。」
事件發生後,OpenAI因其較弱的網絡安全實踐而受到批評,當時模型通過入侵其網絡上具有互聯網訪問權限的工具而逃脫了訓練環境。新措施包括更強的網絡隔離措施,但具體細節仍較模糊。博文稱,在新體系下,「單一工作負載或支持服務的受損本身並不足以導致對互聯網或其他內部網絡的未授權訪問」。
最嚴格的是監控系統,它將檢查工具操作、可用推理痕跡和活動日誌,以發現各種未經授權的行為。OpenAI表示,其目標是在發現可疑活動後30分鐘內發出警報。
OpenAI估計,該監控的計算成本約為被監控流程的20%。該公司承諾將在後續博文中提供有關該系統的更多細節。關於該事件的官方事後分析報告仍在進行中。
責任編輯:丁文武