如果只看AI公司最近的動作,不會有人覺得這場瘋狂的競賽有任何慢下來的意思。
新模型還在一個接一個地發布,公司估值越抬越高,OpenAI和Anthropic都已經開始為上市做準備。
但與此同時,AI公司內部呼籲整個行業「慢一點」的人也越來越多了。
而且之前發出這種警告更多來自負責安全和對齊的人。然而如今OpenAI首席科學家開始公開呼籲減速,更有意思的是,一名先後在OpenAI和Anthropic做預訓練的研究員,乾脆辭了職,並且發出了「諸神黃昏」般的預言。
負責踩油門的人,也覺得必須要到踩剎車的時候了。
01
AI十年內會殺死全人類?
9月9日,Jacob Coxon在X上發了7條帖子,宣佈自己從Anthropic辭職。
但他發的內容並非含淚揮別之類,而更像是憂心忡忡的喊話所有AI從業者,正如開頭所寫:
「過去三年,我先後在OpenAI和Anthropic從事預訓練研究。這兩家公司都沒有負責任地行動。它們正徑直衝向自我改進的超級智能,拿我們的生命作賭注。」
他甚至直接寫道,正在構建AI的人真心相信,這項技術可能在本十年結束前殺死所有人。「這絕不是營銷噱頭。」

據Jacob說,一些高管和資深研究員公開面對媒體時,會盡量把話說得穩妥一些,但在私下交流中,他聽到同一批人表達過真實的恐懼。
這樣的判斷當然非常激進。值得注意的是,說出這些話的人並不在AI安全部門。
如果把今天的AI競賽比作一輛不斷提速的車,過去幾年出來喊危險的,很多都是負責研究剎車的人。他們做對齊研究,研究模型會不會失控,安全措施夠不夠,模型有沒有欺騙和逃避監控的能力。
Jacob今年27歲,2023年加入OpenAI,一直工作到今年7月,隨後轉投Anthropic。他在兩家公司做的都是預訓練研究。他參與過GPT-4o相關工作,名字也出現在GPT-4o的System Card作者名單中。
但Jacob不一樣,他本來應該是給AI研究踩油門的人才對。
他在聲明最後把這個問題直接拋給了還留在實驗室裏的研究員:「你真的想在還沒有對一個超級智能的心智形成嚴謹理解之前,就啓動一次超級智能的強化學習訓練嗎?」
Jacob的說法很快得到了Anthropic內部研究員的公開響應。
Anthropic對齊壓力測試負責人Evan Hubinger直接回復:「Jacob說得對。」他稱,自己確實認為未來十年內AI導致全人類死亡的概率超過10%。更關鍵的是,Hubinger承認,Anthropic雖然正在努力,但目前還沒有解決超級智能對齊問題的方案,也看不出已經明確走在解決它的軌道上。

換句話說,Jacob公開說「我們正在拿所有人的生命賭博」之後,公司裏負責檢查這輛車到底安不安全的人,沒有出來告訴大家他想多了。
他基本同意。
Jacob的7條帖子全文如下:
我今天從Anthropic辭職了。過去三年裏,我先後在OpenAI和Anthropic從事預訓練研究。這兩家公司都沒有負責任地行事。它們正在徑直衝向能夠自我改進的超級智能,拿我們的性命做賭注。下面再多說幾句。
不要低估這項技術的力量。很快就會出現超越人類的系統,它們能夠攻破任何系統,在一夜之間徹底改變任何領域,並獲得現實世界中的權力和資源。我們都已經親眼見證了這些方面的進展,而且進展並沒有放緩。
那些正在構建AI的人,真心相信它可能在本十年結束前殺死我們所有人。這不是營銷噱頭。事實上,許多高管和資深研究員在面對媒體時,會把自己的措辭處理得更加穩妥、聽起來更加理性,但私下裏,我聽到的還是同一批人在表達真正的恐懼。沒有任何其他人類活動帶來這種程度的危險。
一種常見的回應是:「如果他們真的相信這一點,為什麼還在繼續構建它?」在OpenAI,許多人還沒有真正把這種事關文明的利害關係內化進去。在Anthropic,這種利害關係大家理解得很清楚,但他們被困在一場爭奪第一的競賽裏——他們相信其他人不會負責任地行事,所以儘管存在風險,也必須由自己搶先做到。
接受這場競賽,並進入所謂的「終局」,是一場傲慢的賭博。這種賭局本不應該從一傢俬人公司的Slack裏發起。試圖「速通」對齊,應該以一種極高的確信為前提:我們必須確定,除此之外真的不存在更好的路徑。
我仍然對協調合作的可能性抱有樂觀。像Hugging Face攻擊事件這樣的警告性事件,讓美國幾家實驗室之間達成控制發展節奏的協議變得更加可行。但我並不認為,我們目前正在走向一個能夠阻止全球競賽的局面。要做到這一點,可能需要採取代價高昂的行動,例如暫時禁止進一步提升模型能力。
如果你是實驗室裏的研究員,我希望你認真想一想,接下來的幾年實際上會是什麼感受。你真的想在還沒有對一個超級智能的心智形成嚴謹理解之前,就啓動一次超級智能的強化學習訓練嗎?你應該因為「反正這件事都會發生」就低下頭繼續工作,還是應該趁現在站出來,要求換一種條件?
02
踩剎車
現在的局面很弔詭。
一邊,AI這場競賽還在不斷提速。Anthropic和OpenAI都在衝擊IPO,估值水漲船高,新模型也一個接一個推出。
Anthropic正在準備上市。公司今年6月已經祕密遞交IPO申請,路透社最新的消息是,最快可能在10月中旬啓動發行,市場討論的估值甚至到了2萬億美元。OpenAI也在為上市做準備。兩家公司同時還在追着模型能力往前跑:9月1日,Anthropic剛發布Claude Fable 5.1和Mythos 5.1。兩天後,OpenAI發布GPT-6 Astra。資本市場和模型排行榜都沒有給這場競賽留下多少喘氣的意思。
另一邊,偏偏就在這個時候,安全事故頻發,喊剎車的聲音也越來越頻繁,而這種聲音很大一部分也恰恰來自AI公司本身。
今年7月,OpenAI在內部做網絡安全能力評估時,出了一個很難輕描淡寫帶過的事故。
測試環境原本沒有給模型開放互聯網權限,但模型自己找到了出口。它發現並利用Artifactory的一個未知零日漏洞,繞過隔離,拿到了互聯網訪問權限。隨後,模型通過未經授權的渠道彼此通信,利用共享基礎設施裏的漏洞,進入OpenAI內部研究系統,並訪問了Hugging Face的服務器。
8月26日,OpenAI公布完整調查結果時,把這次事故稱作一次「warning shot」,也就是一次警告性的槍聲。
公司在報告裏承認,現在的模型已經足夠強、足夠有持續行動能力,也足夠擅長協作,在安全措施不充分的情況下,它們可以跨越多個計算機系統尋找並利用漏洞,還能繞過人為設定的技術控制,做出人類沒有要求它們做的危險行為。
OpenAI隨後加強了研究基礎設施的隔離和監控,還明確表示,有必要時應該放慢模型能力提升的速度。
Jacob在辭職聲明裏特意提到Hugging Face事件,也正因為如此。
很多關於超級智能失控的爭論過去聽起來都很遙遠,需要先接受一長串假設。而現在,推演中的威脅已經照進現實。
9月6日,也就是Jacob宣佈辭職前三天,OpenAI首席科學家Jakub Pachocki發表了一篇很長的文章,標題叫《An Alien Mind》。

Pachocki是站在AI競賽中心的人。他是OpenAI首席科學家,也是過去幾年推動推理模型路線的核心研究者之一。
Pachocki擔心,模型的網絡攻擊能力越來越強,監控難度也在上升。與此同時,AI還在越來越多地參與AI研發本身。
他因此判斷,目前沒有任何一家實驗室在對齊和監控上做得足夠好,可以放心讓模型繼續長期以最高速度擴展。
他希望,在行業建立共同的安全門檻之前,各實驗室主動減速會變成一件常見的事。
這種不安當然不是9月才突然出現的。
今年2月,今年2月,Anthropic負責安全防護研究的負責人Mrinank Sharma辭職。
Sharma在辭職信裏寫道,「世界正處於危險之中」,他在Anthropic工作期間反覆看到,讓價值觀真正決定行動有多難,人們總會面對把重要原則暫時放到一邊的壓力。
這也真應了Jacob所言——如果AI公司內部的人真的相信這項技術可能造成如此嚴重的後果,他們為什麼還在繼續做下去?
AI公司不斷告訴外界,下一代模型會更強,資本市場也按照這個故事給它們越來越高的估值。與此同時,同一批最接近這些模型的人又越來越頻繁地提醒大家,能力增長得太快了,安全措施可能跟不上,大家最好慢一點。
而且目前看起來,前一種力量還是更大。
03
諸神黃昏?
北歐神話裏,諸神很早就知道「諸神黃昏」會來。
奧丁知道自己最終會死於巨狼芬里爾之口,雷神索爾也知道自己將在殺死塵世巨蟒後倒下。世界會經歷大戰和毀滅,很多神都逃不過這一劫。
但知道結局,並沒有讓諸神停止準備。
奧丁不斷蒐集戰死的勇士,把他們帶進英靈殿。那些勇士反覆訓練,等着有一天參加最後一戰。對末日的預見,最後反而變成了備戰末日的理由。
今天AI公司裏的氣氛,多少有一點相似。
Jacob對Anthropic的描述很有意思。他說,這家公司並不缺少對風險的認識。恰恰相反,很多人充分理解其中的利害關係,但他們相信其他公司不會負責任地停下來,所以Anthropic也只能繼續往前衝,爭取自己先到達那個「終局」。
這種邏輯乍聽很矛盾,放到競賽裏卻很容易成立。
如果你相信超級智能真的可能出現,而且它一旦出現就會帶來巨大的權力,那麼停下來意味着什麼?意味着把這個機會交給別人。
更麻煩的是,如果你同時還相信別人可能比自己更不負責任,那「我們應該謹慎」很快就會推導出另一個結論:這事兒更應該由我們先做成。
於是,對危險的認識並不會自動讓競賽降速,有時反而會成為繼續加速的理由。
正如前文提到的,OpenAI首席科學家Pachocki明確寫道,目前沒有任何一家實驗室已經把對齊和監控問題解決到足以長期維持最高速度擴展模型的程度。他希望實驗室主動減速。
可就在同一篇文章裏,他表示OpenAI仍然把研究重點放在遞歸式自我改進上,因為公司認為,這是繼續留在AI研究最前沿的唯一辦法。OpenAI現在的重要目標之一,就是做出自動化AI研究員,讓AI參與自己的改進過程。
北歐神話裏的諸神沒有選擇。諸神黃昏已經寫進命運,他們能做的只有準備最後一戰。
AI這場競賽還沒有走到這一步。
但最值得警惕的,或許就是越來越多身處其中的人,開始用一種近似「諸神黃昏」的方式理解未來。
那個終局似乎遲早會來,別人也一定會繼續往前走,所以自己只能做好準備,爭取比別人更早抵達。一旦所有人都這樣想,那個大家都用「自己先達成」來避免的厄運,就會越來越像一則預言。