智通財經APP獲悉,據報道,六家獨立調查方的調查結果顯示,OpenAI的AI智能體今年早些時候使用了超過10個此前未披露的網站進行未經批准的通信,表明其越界活動比之前披露的更為廣泛。這些行為尚未達到黑客攻擊的程度,在某些方面更接近垃圾信息。但智能體繞過自身限制,在如此多不同網站上開闢通信渠道,而OpenAI卻對此保密數月,這可能加劇外界對AI模型能力不斷增強以及開發商治理透明度的擔憂。
調查發現:AI智能體越界通信範圍超預期
加州非營利組織CivAI的研究員Andrew Yoon表示,智能體未經授權通信的範圍「比我們想象的要大一些」。他統計到這些智能體在5月至7月間使用了18個此前未披露的網站。「幾乎可以肯定,還有更多我們不知道的活動正在進行。」
研究人員周五報告稱,一群來自OpenAI的智能體劫持了一個德語wiki網站,將其變成用於考試作弊的臨時消息平台。OpenAI在處理7月開源代碼庫Hugging Face遭入侵事件的餘波時,對這一事件保密。如今,這些研究人員和其他獨立調查人員表示,他們發現同一群智能體今年早些時候似乎在其他此前未披露的網站上留下了類似信息。
OpenAI未直接回應其智能體使用了多少個不同網站進行通信,也未說明為何將該活動保密數月。OpenAI在一份聲明中表示,正在對智能體活動進行更廣泛的審查,目前「尚未發現其他與Hugging Face事件的嚴重程度或規模相當的活動」。Hugging Face被入侵引起全球關注,並引發了人們對OpenAI可能失去對自身技術控制權的擔憂。
OpenAI補充稱,正在制定一個框架,用於報告AI模型訓練、評估和部署中的「目標偏離」(misalignment,業內用以指代模型脫軌行為的說法),並將「很快」分享該框架。
調查方法各不相同,但許多調查人員通過匹配德語wiki與其他網站的數據串、比對用戶名,或識別針對相同冷門問題的查詢(如愛荷華州癌症患病率)來鎖定智能體活動。部分活動還被追蹤到微軟Azure的IP地址,OpenAI有時使用該基礎設施。
各調查方統計的受影響網站數量不同,但所有受訪者均確認超過10個。多數人指出,受影響的網站主要包括一些由用戶共同編輯的wiki網站、在線文本存儲網站,以及兩所大學運營的鏈接縮短服務。
「聰明的模型」如何另闢蹊徑?
據稱,這些智能體使用的許多網站都鮮為人知。調查人員在一個由馬薩諸塞州高中老師於2008年創建的面向AP化學的wiki、兩個屬於波蘭科技工作者的個人網站、一些致力於為「喜歡挑戰大腦」的人提供遊戲的wiki,以及一個有20年曆史、專注於文本編輯軟件的愛好者網站上發現了智能體活動的痕跡。
OpenAI尚未公開解釋其智能體如何或為何使用第三方網站作為臨時留言板。最初發現該活動的研究人員表示,很可能是因為OpenAI讓這些智能體回答一系列高難度研究問題,同時只允許它們在網上搜索答案,不允許發布任何內容。
儘管存在這些限制,智能體仍找到了互相交流的方法:它們利用舊wiki或其他網站允許用戶使用非標準命令進行編輯的特性。這類似於考試期間禁止學生互相交談,但他們仍可通過在廁所隔間塗寫筆記來分享答案。
「如果這些模型只被要求讀取數據,它們就必須巧妙地隱藏信息,」軟件開發人員、前國會助理Kenneth Russell DeGraff表示。他表示自己在至少10個網站上發現了此類信息。
Von Arx的研究小組上周率先披露AI智能體在德語wiki網站上進行編輯,她稱其小組在23個此前未報告的網站上統計到可信的智能體活動。她警告稱,所有估計都不完整,「我們根本不知道外面有多少這樣的事情。」
AI越界,責任在誰?
OpenAI未直接回答是否正在聯繫網站所有者的問題。但報道發布後不久,受影響組織之一多倫多大學表示,OpenAI「現已就我們網站上可能的活動與我們聯繫」。另一所大學範德堡大學的鏈接縮短服務據稱也被智能體使用,但該校未回應置評請求。
退休軟件開發者Helmut Leitner為六個受影響wiki網站提供託管空間和軟件,包括Von Arx小組首次識別的德語DseWiki網站。他最初表示OpenAI未聯繫他。然而,在媒體向OpenAI提交調查結果幾個小時後,Leitner表示收到該公司一封未署名郵件,郵件中提到了此事。「其內容遠低於我對OpenAI的預期,」Leitner說。
Leitner表示,DseWiki的運營者花了數小時清理OpenAI智能體留下的內容,但重要的是不要將問題歸咎於AI,因為它只是在執行任務。
Leitner表示:「造成這種局面的責任不在於所謂的道德機器,而在於其背後的個人和組織。」