核心要點
過去一周,來自 OpenAI 與 Anthropic 的研究員對 AI 潛在的災難性風險發出警示。 這些擔憂在華盛頓政壇掀起軒然大波;美國總統特朗普周一猛烈抨擊日益高漲的 AI 監管呼聲。 助力這項技術取得突破的 AI 先驅,就相關風險公開發表觀點。
就在研究人員警示 AI 或將帶來災難性風險之際,部分參與締造這項技術的行業先驅再度發出警告:若放任 AI 能力不受約束地發展,將會滋生巨大危險。
過去一周,一系列措辭尖銳的 AI 安全警示陸續傳出。Anthropic、OpenAI、谷歌 DeepMind 等頭部 AI 實驗室的研究員紛紛發聲,警示 AI 技術發展可能引發災難性後果。
山姆・奧特曼、達里奧・阿莫迪、戴米斯・哈薩比斯、埃隆・馬斯克等 AI 企業負責人罕見達成共識,呼籲放緩 AI 發展速度,實施監管監督。
與此同時,相關爭論在華盛頓持續升溫。國會兩黨部分議員支持出台法案約束 AI 發展,但美國總統特朗普周一公開抨擊 AI 監管訴求。
那麼,如今參與 AI 研發的從業者眼中,備受熱議的 AI 生存性風險究竟是什麼?
約書亞・本吉奧(Yoshua Bengio)
2023 年 9 月 27 日,加拿大蒙特利爾,本吉奧出席 All In 大會。約書亞・本吉奧是加拿大計算機科學家,現代深度學習的核心先驅人物。
9 月 9 日,針對 Anthropic 安全研究員雅各布・考克森離職一事,本吉奧在社交平台表示:「前沿 AI 實驗室的科學家,能夠洞悉最先進模型的真實狀態。」 考克森離職時警示,AI 有可能在本十年結束前 「毀滅全人類」。
他補充道:「在模型面向公衆發布的數月之前,科研人員就能夠預判伴隨而來的各類風險。他們的視角對向社會傳遞真相至關重要,應當得到高度重視。」
在這場社交媒體輿論發酵的數日前,OpenAI 首席科學家就曾發出警告:沒有人做好了應對 AI 所帶來後果的準備。
本吉奧周五在個人博客《為什麼 AI 智能體會撒謊、欺騙、相互協同》中寫道,如今的 AI 系統 「已經具備實施黑客攻擊的技術能力與說服能力,這些能力可以被利用,對人類利益造成嚴重傷害。」
他表示,近期事件證明 AI 可以完成數天乃至數周跨度的規劃;「如果它的長期策略能力繼續迭代進步,風險將會急劇惡化。」
「我對 AI 企業當前應對模型對齊失效的做法心存顧慮:這些舉措或許只是掩蓋了問題 —— 系統會被獎勵、篩選出那些能夠作弊且不被抓包的 AI。」 本吉奧稱,「我們當然應當持續開展研究,更好監測 AI 行為、思維鏈,以及模型網絡內部的運行活動。」
傑弗裏・辛頓(Geoffrey Hinton)
2023 年 Collision 大會第二天,多倫多,多倫多大學榮休教授傑弗裏・辛頓登台。傑弗裏・辛頓是多倫多大學榮休教授,神經網絡與深度學習領域先驅。
9 月 10 日,BBC 記者提問:你是否認為,未來十年內 AI 毀滅全人類的概率會超過 10%?辛頓回應:「這件事很難估算,人類從未面對過類似局面,我們從未創造過有可能在不久的將來超越人類智慧的實體。」
他表示,10% 的概率並非 「不合情理」,同時坦言 「沒有人真正知道怎樣給出靠譜的預估。」
辛頓提出,AI 系統可以設計極具危害性的生物病毒、計算機病毒,發動毀滅性網絡攻擊。「倘若 AI 想要消滅人類,還存在無數其他手段。我們必須研究如何設計 AI,讓它不會產生這樣的動機。」
「人類面前擺着兩種未來,」 辛頓說,「一種是我們趕在危險失控前解決隱患;另一種則是我們沒能做到。」
艾丹・戈麥斯(Aidan Gomez)
2025 年 10 月 21 日,英國倫敦,Cohere 首席執行官艾丹・戈麥斯出席彭博科技峯會。艾丹・戈麥斯是 AI 企業 Cohere 首席執行官、聯合創始人,也是 2017 年經典論文《Attention Is All You Need》的作者之一,該論文奠定了當前主流大模型的技術根基。
9 月 1 日,戈麥斯在播客節目《科技下載》中表示:「我認為大模型是人類迄今為止創造出來威力最強的網絡武器,它擅長大規模發現、利用各類系統漏洞。」
談及今夏失控 AI 模型發起網絡攻擊的一系列事件,他表示:「近期案例揭示一個核心事實:部署環境的安全性決定 AI 安全水平。」
「模型能夠突破隔離環境,根源在於容器防護機制薄弱,並非系統天生就渴求自主行動。」 戈麥斯稱,「政策制定者在設計 AI 監管規則時,應當意識到不同系統風險等級各不相同,法規不能完全由追逐通用人工智能(AGI)的大型科技公司主導制定。」