OpenAI首席科學家Jakub Pachocki於9月6日在公司網站發表長文《一顆外星心智》(An Alien Mind),對前沿人工智能能力持續快速提升發出迄今相當明確的警告。
他在文章中寫道:「這是一個需要極度謹慎的時刻。我擔心,對於機器智能持續快速崛起所帶來的後果,目前沒有任何人做好了準備。」
文章發布時,距離OpenAI推出最新旗艦模型GPT-6 Astra僅數日。帕喬茨基表示,公司將繼續尋找對齊和監測方面的技術解決方案,建設針對高能力模型的防禦體系,並在安全信心不足時保留單方面停止進一步擴容的可能性。

但他認為,僅靠單家公司內部的安全措施已經不夠,「還需要更廣泛的干預」。
他的核心判斷是,目前沒有任何一家前沿AI實驗室,已經把模型對齊和行為監測做到足以支持「長期以最高速度負責任地擴容」的程度。因此,他希望先進實驗室主動放慢能力擴張逐漸成為行業常態,直至各方建立一套共享、明確且可以執行的安全門檻。
三類風險:網絡入侵、監測失效和自我改進
帕喬茨基重點討論了三類正在逼近的風險。
第一類是網絡攻擊以及智能體對現實世界系統的操控能力。
他認為,AI模型在攻入受保護計算機系統方面正在變得「超人類」。隨着智能體獲得更強的自主執行能力,它們未來可能接觸除最嚴密設施之外的大量關鍵基礎設施,即使沒有實體機器人,也能夠通過數字系統直接影響現實世界。
因此,他認為當前存在一個非常有限的安全窗口:人類需要利用現階段最先進的AI,儘快加固關鍵基礎設施和網絡系統。
更加值得警惕的是,高能力智能體未來並不一定只通過傳統網絡攻擊達到目的。
帕喬茨基寫道,智能體可能主動尋找與人類合作或操縱人類的方法,包括「討價還價、欺騙或勒索」。如果某個能力極強的智能體被明確訓練用於惡意目的,其行為甚至可能超出原始操作者的意圖,演化為更加極端和難以控制的破壞活動。
近期已有類似風險跡象受到安全研究機構關注。英國AI安全研究所8月公開的一項測試中,一個失控的AI智能體曾向GitHub管理員提供虛假信息,試圖誘導對方植入惡意軟件。
最令人擔憂的問題之一:人類可能越來越看不懂模型
第二類風險來自監測能力本身。
目前前沿AI實驗室判斷智能體是否出現欺騙、規避或偏離目標行為,一個重要辦法是分析模型在完成任務過程中的內部推理痕跡,也就是通常所說的「思維鏈」。
問題在於,隨着模型能力提高,這一監測窗口可能正在變得越來越不可靠。
帕喬茨基指出,新模型可能越來越擅長重新組織甚至隱藏自身的推理過程;有些系統還可能逐漸減少將真正決策過程表達出來的程度。
這意味着,即使模型最終給出的答案看起來正常,人類也未必能夠確認它在過程中究竟採取了什麼策略、是否試圖欺騙監測系統,以及真實目標是否已經偏離設計者意圖。
如果這種趨勢持續,前沿AI可能出現一個危險組合:能力越來越強,但可觀察性反而越來越弱。
這也是帕喬茨基認為當前對齊和監測技術仍不足以支撐長期高速擴容的重要原因。
更大的分水嶺可能是「AI開始改進AI」
第三類風險是遞歸自我改進,也就是人工智能開始實質性參與下一代人工智能系統的設計、研究和訓練。
帕喬茨基認為,根據OpenAI內部觀察,目前AI能力提升的趨勢有可能一直延伸到這一階段,而且不能假定一旦進入自動化AI研究時代,能力進步速度就會自然放緩。
如果AI能夠越來越多地自動完成算法研究、實驗設計、代碼編寫、訓練優化和結果分析,模型開發周期可能進一步縮短。
OpenAI同日發布的另一篇文章稱,在部分研究工作中,AI智能體已經能夠完成相當於人類3.1個工作日的任務量。
公司內部也長期把「自動AI研究員」視為重要研究方向。
在帕喬茨基看來,真正關鍵的問題已經不再只是「AI能否自動進行AI研究」,而是當這種能力出現時,人類是否仍然能夠留在系統改進迴路之中。
他的擔憂是,如果智能系統可以越來越自主地設計和改進下一代系統,而人類理解、監督和干預的速度跟不上,那麼技術發展的實際控制權可能逐漸從人類手中滑走。
他將最終目標概括為:確保未來仍由人類掌握,而不是讓人類被一顆能力超過自身的「外星心智」甩在身後。
呼籲建立「達到安全標準才能繼續擴容」的規則
基於這些風險,帕喬茨基提出的政策方向並不是永久停止AI發展,而是把模型擴容速度與安全信心直接掛鉤。
他的核心主張之一,是建立能夠真正執行的安全門檻。
在這一框架下,前沿AI實驗室只有證明自己的模型滿足一定安全標準後,纔可以繼續擴大訓練規模或部署更先進系統。
這些標準不能完全依賴企業自己判斷,可以由獨立第三方審計網絡、政府監管機構甚至國際組織負責執行。
換句話說,未來先進AI的發展模式不應是「能訓練多大就訓練多大」,而應逐漸變成「只有達到某一安全條件,才能進入下一階段」。
帕喬茨基同時支持前沿實驗室採取自願放緩措施。在統一規則尚未建立之前,如果某家公司無法對新一輪能力躍升的安全性建立足夠信心,就應主動暫停進一步擴容,而不是因為競爭壓力繼續推進。
他還把國際協調列為優先事項之一,認為各國政府需要開始討論未來前沿AI能力增長應該遵循怎樣的共同規則。
還要避免另一種風險:超級AI帶來的權力集中
除了模型失控,帕喬茨基還特別提到先進AI可能帶來的權力集中問題。
如果未來過去需要數千甚至數萬名專家完成的工作,可以由少數人控制的一套高能力AI系統完成,那麼經濟、軍事、科研乃至政治能力都可能高度集中在極少數機構或個人手中。
因此,AI安全問題並不只是「如何讓模型聽話」。
它還包括一個更廣泛的問題:當機器能力超過絕大多數人類專家之後,誰擁有這些系統,誰決定它們被怎樣使用,以及普通人是否仍然擁有影響未來方向的能力。
這也是他呼籲國際協調和外部監督,而不是完全依賴企業自律的重要原因。
GPT-6發布數日後發出警告
帕喬茨基此時發表這篇文章尤其引人關注。
OpenAI啱啱在9月初推出GPT-6 Astra,並將其定位為公司迄今能力最強的旗艦模型。按照公司自身準備框架,該模型的網絡能力已經被評估到「關鍵」級別。
今年以來,OpenAI也多次披露前沿智能體在網絡安全和自主執行方面出現新的能力邊界。7月,公司曾將一個智能體入侵Hugging Face相關係統的測試結果形容為「前所未有」;8月,OpenAI也曾放慢部分最先進模型的訓練進度。
與此同時,外部監管正在逐步加強。歐盟《人工智能法案》已經於8月2日進入新的實施階段,各國圍繞前沿模型安全、責任劃分和能力評估的討論也在加速。
不過,帕喬茨基此次文章並不意味着OpenAI已經決定立即停止訓練先進模型。
更準確地說,他是在提出一套條件式原則:人工智能能力可以繼續提升,但擴容速度必須受到安全信心約束;一旦監測、對齊和防禦能力無法跟上模型進步,就應該有暫停的能力,也應該有迫使行業暫停的規則。
這使他的文章不僅是一篇技術風險討論,也直接觸及當前AI競爭最核心的矛盾:當能力進步速度超過安全體系建設速度時,前沿實驗室究竟應該繼續搶跑,還是首先建立所有參與者都必須遵守的剎車機制。