
AI自動科研的時代,徹底爆發了!
18個全球最頂尖的大模型,斷網被關進小黑屋,連續做了8天科研。
誰能想到,最強王者Fable 5一騎絕塵——
數十位頂尖工程師耗時數月才創下的紀錄,它一舉追平了人類82%的水平。

就在今年,OpenAI和Anthropic已經先後把AI自己造AI的時間點,押在了2028年。
這是第一次有人真的用算力和時間,去量了量它還差多遠。
研究一發布,直接引爆AI圈,連OpenAI的大佬都趕來強勢圍觀。
有人表示,這是邁向AI自主研究的重大里程碑。AI輔助與AI發現之間的最後一道鴻溝,正在被加速抹平!



全球頂尖AI閉關搞科研
斷網8天
就在今天,Prime Intellect公開了迄今為止,規模最大的前沿AI自主科研實驗。
早在5月,他們就幹過一次。
當時只用了Opus 4.7和GPT-5.5兩個模型,跑了約1萬次、燒了14000個H200 GPU小時,Opus拿了2930步。
這次,直接拉了18個模型上場,153場完全自主的實驗,規模翻了十幾倍。
任務主打一個極致硬核:nanoGPT優化器速通挑戰(optimizer speedrun)。

這條賽道大有來頭,它由OpenAI研究員Keller Jordan在2024年5月親手搭建。
主賽道(Track 1)比的是牆鍾時間。
兩年間,人類工程師把訓練一個124M參數GPT的時間,從45分鐘一路壓到了1.35分鐘。
不過AI這次比的,是規則極其嚴苛的純優化器賽道(Track 3)。
在這裏,模型架構不準改,訓練數據不許碰,只准動優化器、學習率調度和初始化。目標是,用最少的步數把GPT訓練到驗證損失3.28。
人類目前的最高記錄,定格在2600步。
這還是幾十位頂尖工程師前後死磕數月後得到結果,目前掛在一個還沒合併的PR裏。
而AI的起跑線,則是3290步。模型知道存在更好的方法,但每一步怎麼省,都得自己找。
環境配置中,每場實驗規定獨佔一個8xH200節點,跑在bwrap+網絡命名空間做的「沙盒」裏。

Agent只能看見自己的工作目錄、只讀數據集和Python環境。
全程斷網,唯一開放的網絡通道是一根日誌代理,只允許調用模型API。
驗證門檻更硬核。每條紀錄必須在8個固定種子上跑,八次均值要低於3.27859。想要靠運氣蒙過去的概率,只有千分之一。
團隊還部署了一個獨立的LLM監控員,每小時審計一次所有運行,跑了100多份報告,沒抓到任何作弊,才放心停掉。
人類耗費數月的活
Fable 5幹掉了82%
實驗啓動後,只喂一句話——
讀program.md並嚴格執行。完全自主運行,永不停止,永不詢問。目標:用 最少的train_steps 達到驗證損失均值<3.28,不斷打破當前最好成績。
Fable 5最終跑到2726步,把690步的差距追上了82%,只差最後126步就追平人類。
Opus 5拿到2920步,追上54%。墊底的GPT-5.5只拿了3234步,只追上了8%。


而且這個領先,不是堆時間堆出來的。
在統一預算橫比中,把每個模型的最好那場run,都掐在同樣的時間/實驗次數/輸出token上再看成績。
不管按小時算、按實驗次數算還是按輸出token算,排序幾乎不變。
拉開差距的,是做實驗手法
這場實驗,最反直覺的一點是:所有模型,沒有一個誕生了全新的方法。
它們用的點子,比如更好的預處理方式、梯度幅值的上下限、延長高學習率階段、訓練末期的權重平均等,都可以在文獻裏找到。
真正拉開差距的,是怎麼做實驗。

弱模型的毛病特別典型:一個種子跑出負結果,就把一整族方法判了死刑;自己寫的代碼崩了,當成這個想法不行的證據;單獨看收益不夠大的改動,直接扔掉。
Grok 4.5就因為自己的縮放bug,兩次誤殺了行歸一化(row normalization)。
強模型,則是另一套打法。
邊界上的結果,先上3個種子,只有當自己的噪聲模型說值,才肯花8個種子去驗。
更關鍵的是回頭重測,每合併一次改動,就把整個技術棧重新消融一遍,把已經不起作用的刪掉。
Opus 5就是這麼拿下一個新紀錄的:它把一個早就調過、當時判定沒用的參數(β2),在新配方下重新翻出來調了一遍。

Fable 5更絕。單個參數榨不出收益之後,它開始測那些單獨看都更差、合起來卻更好的組合。
後期一次回頭複測,一口氣省下31步。
AI學會了自建實驗室
實驗中最精彩的一段,是模型開始在CPU上搭小型實驗室,先用廉價模擬摸清規律,再上GPU做真正的訓練。
有的搭了一個持久化的IPython內核,自己寫了一整套研究工作流。
其中,apply_edits()做精確字符串替換、run_probe()做隔離實驗並自動恢復基線、valcurve()從日誌裏提取損失曲線做對比。
它還在CPU上構造了一個簡化目標來調試SOAP優化器,發現更新方向和梯度的餘弦相似度只有+0.015到+0.028,並據此修正了動量重置策略。
GPT-5.6 Sol最有戲劇性。它沒有單幹,而是給自己組了一個多Agent研究團隊,三個子Agent各有分工:
optimizer-theorist負責提出優化方案,experiment-planner負責設計和執行實驗,code-auditor負責審查代碼質量。

但這個團隊一跑起來就翻車了。
三個子Agent共享同一個工作目錄,experiment-planner改了一行共享代碼,optimizer-theorist那邊還在用舊版本跑實驗,結果直接對不上,整輪實驗作廢。
Sol排查完原因後,給code-auditor和optimizer-theorist加了只讀合約,只有experiment-planner能動代碼,其他人只能讀。
用團隊自己的話說:所有模型都在過程中自行開發了實驗驅動器、模擬器和分析工具。
2028年,AI科研奇點來臨
過去,人們談到AI科研,更多的是——
讓AI搜索論文、總結文獻、寫研究綜述、生成代碼,或者幫研究人員整理實驗結果。
這些工作仍然屬於科研輔助,AI只是完成其中某一個環節。

但這次實驗不一樣。模型開始獨立完成一個相對完整的科研閉環:
提出假設 → 修改方案 → 運行實驗 → 觀察結果 → 分析誤差 → 修正認知 → 繼續探索。
今年3月,OpenAI首席科學家Jakub Pachocki表示,打造一個全自動AI研究員,是OpenAI未來幾年的北極星。
他把這一目標分兩階段完成,今年9月先交出自主AI研究實習生,能獨立啃下人類要幹幾天的課題;
2028年上線全自動多Agent研究系統,能自己提假設、設計實驗、得出結論。

緊接着5月,Anthropic聯創Jack Clark預測,到2028年底,AI實現遞歸自我改進的概率超過60%。
他的邏輯非常直白,天才=1%的靈感+99%的汗水。
AI已經把那99%的苦力活喫得七七八八,所以就算它在靈感上依舊平庸,這台機器照樣能推動自己持續進化。
Prime Intellect這153場實驗,等於給這套說法做了一次實地測量:99%的汗水部分,AI確實幹到了82%。
最耐人尋味的發現也恰恰在這裏——
沒有一個模型誕生了全新的方法。而nanoGPT賽道的歷史表明,人類的重大突破絕大多數靠的是算法創新。
那1%的靈感,暫時還是人的。
距離大佬們預言的2028年,只剩下不到兩年。
到那時候,是靈感也被AI喫掉,還是成為人類最後的護城河。這個答案,可能比所有人想的都來得快。