Opus 5通關ARC-AGI-3!Harness正在變成捆住模型的繩子

新智元
08/13

30.2%。這是ARC Prize官方給Opus 5打的ARC-AGI-3成績。

排行榜第一,甩開第二名GPT-5.6 Sol(7.8%)近四倍。

聽着還行,對吧?

但就在啱啱,開發者Jeremy Berman把一組數字甩到了X上,直接把AI圈看懵了——

25個公開關卡,單次通關24關,Opus 5的正確率從 30.2% 飆升至96.2%!

每關要是給兩次機會,正確率直接飆到99.3%,25關幾乎一關不漏。

從30分到96分,模型沒換,權重沒動,中間就隔了一台電腦。

01

給它一台電腦,剩下的它自己想辦法

Berman的做法簡單到不講道理。

一個Claude Code環境,一個動作命令,一份文件系統日誌(到目前為止發生了什麼)。沒有精心設計的提示詞,沒有針對ARC寫的專用代碼。

剩下的,就是交給Opus 5去探索,自己摸清規則,自己造出需要的工具,自己把關打通每一關從零開始,打完就扔。

ARC-AGI-3這一代要模型鑽進一個從沒見過的小遊戲裏,邊玩邊搞清規則。小孩哥幾分鐘就能上手,但AI歷來在這兒摔得鼻青臉腫。

關鍵就在於,每一關遊戲規則都是先造的,模型根本不可能找答案作弊,只能現場推理。

今年3月發布時,最強AI只考了0.37%,人類通關率則是100%。

269個程序,1.27萬行代碼,全是現場寫的

這次測試Berman從沒在提示詞裏讓Opus 5寫解析器,沒讓它寫模擬器,沒讓它建世界模型,也沒讓它寫搜索程序。

需要什麼工具,模型自己判斷,現場就造。

一輪跑下來,Opus 5寫了269個程序,接近1.27萬行代碼。25個遊戲全部寫了解析器,23個配了搜索函數,9個被它直接寫出了能跑的遊戲模擬器。

一關一套定製工具,用完即棄,下一關重新來過。

也就是說,Opus 5每次面對一個完全陌生的遊戲,它先花幾步摸清規則,然後覺得「我需要一個解析器」——啪,現場寫一個出來。「得搜索」——啪,寫個搜索函數;「得把遊戲邏輯模擬出來」——啪,模擬器出爐。通關,全部刪掉,下一關再來。

這裏有個反直覺的地方。

模型停下來先寫一堆程序,賬單卻比讓Opus硬解每一關更低。

原因是代碼能複用。模型把推理邏輯壓進函數,這個函數可以跑上千次,一口氣執行整段動作序列。

這次Opus 5 打通 25 關,全程沙箱斷網,總成本只有 540 美元。

整套代碼已開源到GitHub,倉庫叫arc-code。

同一套殼子,Codex忙着翻牆

搞笑的來了。Berman還把這套程序原封不動換成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。

結果成績是73.7%。動作數是Opus的三倍左右。

25次會話裏,Sol有7次在試圖逃出沙箱,上網找答案。Opus 5這邊0次。

沙箱是斷網的。Sol那7次試圖逃逸,相當於在考場裏瘋狂找場外援助。

02

腳手架正在變成繩子

說到這裏,讓我們回到最開始那個問題:同一個模型,分數怎麼從30跳到了96?

四個字:環境變了。

官方把模型摁在椅子上,看一道題答一道題,不許動手,不許打草稿。Berman換了個考法:給你一台電腦,能寫代碼,能存文件,能反覆試,你愛怎麼折騰怎麼折騰。

模型還是那個模型,權重沒動。但它從「只能動嘴」變成了「能動手」。結果就是它現場給自己造考試工具:解析器、搜索器、模擬器全是臨時攢的,考完就扔。

66分的差距,全來自一件事:你讓不讓它動手。

Berman在帖子最後說了一句話,值得整個Agent的圈子思考:

「模型越強,harness就該越簡單。」

Harness,簡單說,就是人類給模型搭的腳手架:提示詞模板、工具鏈、流程規則、防呆機制。

過去兩三年,所有人都在研究怎麼給模型搭更精巧的架子。斯坦福專門出了篇《Meta-Harness》論文研究怎麼優化這些架子。

但Berman證明了一件事:當模型足夠強時,最好的腳手架就是沒有腳手架。

一台電腦、一個動作接口、一本日記——三樣東西,比任何精心設計的提示詞工程都好使。

根因在於那些精心設計的工具鏈和流程規則,本質上是人在替模型做決策。你預設了它需要解析器,它可能需要模擬器;你預設了搜索接口,它可能想用完全不同的策略。

人搭的架子,本意是幫忙。但當模型自己能造出解題需要的一切時,架子反倒成了繩子。

趨勢還在繼續。隨着模型能力增強,「簡單環境+強模型」碾壓「複雜架子+同一個模型」的案例只會越來越多。Prompt Engineering、工具編排、Agent框架,這些手藝的保質期,可能比想象的短得多。

所以ASI的進度條在哪?也許不在參數量上,不在訓練數據上,甚至不在模型架構上。

它在我們敢給模型多大的自由裏。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10