Fable 5奪冠!全球18大頂尖AI自主科研大賽,逼近人類極限

新智元
08/17

AI自動科研的時代,徹底爆發了!

18個全球最頂尖的大模型,斷網被關進小黑屋,連續做了8天科研。

誰能想到,最強王者Fable 5一騎絕塵——

數十位頂尖工程師耗時數月才創下的紀錄,它一舉追平了人類82%的水平。

就在今年,OpenAI和Anthropic已經先後把AI自己造AI的時間點,押在了2028年。

這是第一次有人真的用算力和時間,去量了量它還差多遠。

研究一發布,直接引爆AI圈,連OpenAI的大佬都趕來強勢圍觀。

有人表示,這是邁向AI自主研究的重大里程碑。AI輔助與AI發現之間的最後一道鴻溝,正在被加速抹平!

全球頂尖AI閉關搞科研

斷網8天

就在今天,Prime Intellect公開了迄今為止,規模最大的前沿AI自主科研實驗。

早在5月,他們就幹過一次。

當時只用了Opus 4.7和GPT-5.5兩個模型,跑了約1萬次、燒了14000個H200 GPU小時,Opus拿了2930步。

這次,直接拉了18個模型上場,153場完全自主的實驗,規模翻了十幾倍。

任務主打一個極致硬核:nanoGPT優化器速通挑戰(optimizer speedrun)。

這條賽道大有來頭,它由OpenAI研究員Keller Jordan在2024年5月親手搭建。

主賽道(Track 1)比的是牆鍾時間。

兩年間,人類工程師把訓練一個124M參數GPT的時間,從45分鐘一路壓到了1.35分鐘。

不過AI這次比的,是規則極其嚴苛的純優化器賽道(Track 3)。

在這裏,模型架構不準改,訓練數據不許碰,只准動優化器、學習率調度和初始化。目標是,用最少的步數把GPT訓練到驗證損失3.28。

人類目前的最高記錄,定格在2600步。

這還是幾十位頂尖工程師前後死磕數月後得到結果,目前掛在一個還沒合併的PR裏。

而AI的起跑線,則是3290步。模型知道存在更好的方法,但每一步怎麼省,都得自己找。

環境配置中,每場實驗規定獨佔一個8xH200節點,跑在bwrap+網絡命名空間做的「沙盒」裏。

Agent只能看見自己的工作目錄、只讀數據集和Python環境。

全程斷網,唯一開放的網絡通道是一根日誌代理,只允許調用模型API。

驗證門檻更硬核。每條紀錄必須在8個固定種子上跑,八次均值要低於3.27859。想要靠運氣蒙過去的概率,只有千分之一。

團隊還部署了一個獨立的LLM監控員,每小時審計一次所有運行,跑了100多份報告,沒抓到任何作弊,才放心停掉。

人類耗費數月的活

Fable 5幹掉了82%

實驗啓動後,只喂一句話——

讀program.md並嚴格執行。完全自主運行,永不停止,永不詢問。目標:用 最少的train_steps 達到驗證損失均值<3.28,不斷打破當前最好成績。

Fable 5最終跑到2726步,把690步的差距追上了82%,只差最後126步就追平人類。

Opus 5拿到2920步,追上54%。墊底的GPT-5.5只拿了3234步,只追上了8%。

而且這個領先,不是堆時間堆出來的。

在統一預算橫比中,把每個模型的最好那場run,都掐在同樣的時間/實驗次數/輸出token上再看成績。

不管按小時算、按實驗次數算還是按輸出token算,排序幾乎不變。

拉開差距的,是做實驗手法

這場實驗,最反直覺的一點是:所有模型,沒有一個誕生了全新的方法。

它們用的點子,比如更好的預處理方式、梯度幅值的上下限、延長高學習率階段、訓練末期的權重平均等,都可以在文獻裏找到。

真正拉開差距的,是怎麼做實驗。

弱模型的毛病特別典型:一個種子跑出負結果,就把一整族方法判了死刑;自己寫的代碼崩了,當成這個想法不行的證據;單獨看收益不夠大的改動,直接扔掉。

Grok 4.5就因為自己的縮放bug,兩次誤殺了行歸一化(row normalization)。

強模型,則是另一套打法。

邊界上的結果,先上3個種子,只有當自己的噪聲模型說值,才肯花8個種子去驗。

更關鍵的是回頭重測,每合併一次改動,就把整個技術棧重新消融一遍,把已經不起作用的刪掉。

Opus 5就是這麼拿下一個新紀錄的:它把一個早就調過、當時判定沒用的參數(β2),在新配方下重新翻出來調了一遍。

Fable 5更絕。單個參數榨不出收益之後,它開始測那些單獨看都更差、合起來卻更好的組合。

後期一次回頭複測,一口氣省下31步。

AI學會了自建實驗室

實驗中最精彩的一段,是模型開始在CPU上搭小型實驗室,先用廉價模擬摸清規律,再上GPU做真正的訓練。

有的搭了一個持久化的IPython內核,自己寫了一整套研究工作流。

其中,apply_edits()做精確字符串替換、run_probe()做隔離實驗並自動恢復基線、valcurve()從日誌裏提取損失曲線做對比。

它還在CPU上構造了一個簡化目標來調試SOAP優化器,發現更新方向和梯度的餘弦相似度只有+0.015到+0.028,並據此修正了動量重置策略。

GPT-5.6 Sol最有戲劇性。它沒有單幹,而是給自己組了一個多Agent研究團隊,三個子Agent各有分工:

optimizer-theorist負責提出優化方案,experiment-planner負責設計和執行實驗,code-auditor負責審查代碼質量。

但這個團隊一跑起來就翻車了。

三個子Agent共享同一個工作目錄,experiment-planner改了一行共享代碼,optimizer-theorist那邊還在用舊版本跑實驗,結果直接對不上,整輪實驗作廢。

Sol排查完原因後,給code-auditor和optimizer-theorist加了只讀合約,只有experiment-planner能動代碼,其他人只能讀。

用團隊自己的話說:所有模型都在過程中自行開發了實驗驅動器、模擬器和分析工具。

2028年,AI科研奇點來臨

過去,人們談到AI科研,更多的是——

讓AI搜索論文、總結文獻、寫研究綜述、生成代碼,或者幫研究人員整理實驗結果。

這些工作仍然屬於科研輔助,AI只是完成其中某一個環節。

但這次實驗不一樣。模型開始獨立完成一個相對完整的科研閉環:

提出假設 → 修改方案 → 運行實驗 → 觀察結果 → 分析誤差 → 修正認知 → 繼續探索。

今年3月,OpenAI首席科學家Jakub Pachocki表示,打造一個全自動AI研究員,是OpenAI未來幾年的北極星

他把這一目標分兩階段完成,今年9月先交出自主AI研究實習生,能獨立啃下人類要幹幾天的課題;

2028年上線全自動多Agent研究系統,能自己提假設、設計實驗、得出結論。

緊接着5月,Anthropic聯創Jack Clark預測,到2028年底,AI實現遞歸自我改進的概率超過60%。

他的邏輯非常直白,天才=1%的靈感+99%的汗水。

AI已經把那99%的苦力活喫得七七八八,所以就算它在靈感上依舊平庸,這台機器照樣能推動自己持續進化。

Prime Intellect這153場實驗,等於給這套說法做了一次實地測量:99%的汗水部分,AI確實幹到了82%。

最耐人尋味的發現也恰恰在這裏——

沒有一個模型誕生了全新的方法。而nanoGPT賽道的歷史表明,人類的重大突破絕大多數靠的是算法創新。

那1%的靈感,暫時還是人的。

距離大佬們預言的2028年,只剩下不到兩年。

到那時候,是靈感也被AI喫掉,還是成為人類最後的護城河。這個答案,可能比所有人想的都來得快。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10