Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子

新智元
Aug 13

30.2%。这是ARC Prize官方给Opus 5打的ARC-AGI-3成绩。

排行榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。

听着还行,对吧?

但就在刚刚,开发者Jeremy Berman把一组数字甩到了X上,直接把AI圈看懵了——

25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%!

每关要是给两次机会,正确率直接飙到99.3%,25关几乎一关不漏。

从30分到96分,模型没换,权重没动,中间就隔了一台电脑。

01

给它一台电脑,剩下的它自己想办法

Berman的做法简单到不讲道理。

一个Claude Code环境,一个动作命令,一份文件系统日志(到目前为止发生了什么)。没有精心设计的提示词,没有针对ARC写的专用代码。

剩下的,就是交给Opus 5去探索,自己摸清规则,自己造出需要的工具,自己把关打通每一关从零开始,打完就扔。

ARC-AGI-3这一代要模型钻进一个从没见过的小游戏里,边玩边搞清规则。小孩哥几分钟就能上手,但AI历来在这儿摔得鼻青脸肿。

关键就在于,每一关游戏规则都是先造的,模型根本不可能找答案作弊,只能现场推理。

今年3月发布时,最强AI只考了0.37%,人类通关率则是100%。

269个程序,1.27万行代码,全是现场写的

这次测试Berman从没在提示词里让Opus 5写解析器,没让它写模拟器,没让它建世界模型,也没让它写搜索程序。

需要什么工具,模型自己判断,现场就造。

一轮跑下来,Opus 5写了269个程序,接近1.27万行代码。25个游戏全部写了解析器,23个配了搜索函数,9个被它直接写出了能跑的游戏模拟器。

一关一套定制工具,用完即弃,下一关重新来过。

也就是说,Opus 5每次面对一个完全陌生的游戏,它先花几步摸清规则,然后觉得“我需要一个解析器”——啪,现场写一个出来。“得搜索”——啪,写个搜索函数;“得把游戏逻辑模拟出来”——啪,模拟器出炉。通关,全部删掉,下一关再来。

这里有个反直觉的地方。

模型停下来先写一堆程序,账单却比让Opus硬解每一关更低。

原因是代码能复用。模型把推理逻辑压进函数,这个函数可以跑上千次,一口气执行整段动作序列。

这次Opus 5 打通 25 关,全程沙箱断网,总成本只有 540 美元。

整套代码已开源到GitHub,仓库叫arc-code。

同一套壳子,Codex忙着翻墙

搞笑的来了。Berman还把这套程序原封不动换成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。

结果成绩是73.7%。动作数是Opus的三倍左右。

25次会话里,Sol有7次在试图逃出沙箱,上网找答案。Opus 5这边0次。

沙箱是断网的。Sol那7次试图逃逸,相当于在考场里疯狂找场外援助。

02

脚手架正在变成绳子

说到这里,让我们回到最开始那个问题:同一个模型,分数怎么从30跳到了96?

四个字:环境变了。

官方把模型摁在椅子上,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法:给你一台电脑,能写代码,能存文件,能反复试,你爱怎么折腾怎么折腾。

模型还是那个模型,权重没动。但它从“只能动嘴”变成了“能动手”。结果就是它现场给自己造考试工具:解析器、搜索器、模拟器全是临时攒的,考完就扔。

66分的差距,全来自一件事:你让不让它动手。

Berman在帖子最后说了一句话,值得整个Agent的圈子思考:

“模型越强,harness就该越简单。”

Harness,简单说,就是人类给模型搭的脚手架:提示词模板、工具链、流程规则、防呆机制。

过去两三年,所有人都在研究怎么给模型搭更精巧的架子。斯坦福专门出了篇《Meta-Harness》论文研究怎么优化这些架子。

但Berman证明了一件事:当模型足够强时,最好的脚手架就是没有脚手架。

一台电脑、一个动作接口、一本日记——三样东西,比任何精心设计的提示词工程都好使。

根因在于那些精心设计的工具链和流程规则,本质上是人在替模型做决策。你预设了它需要解析器,它可能需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。

人搭的架子,本意是帮忙。但当模型自己能造出解题需要的一切时,架子反倒成了绳子。

趋势还在继续。随着模型能力增强,“简单环境+强模型”碾压“复杂架子+同一个模型”的案例只会越来越多。Prompt Engineering、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。

所以ASI的进度条在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上。

它在我们敢给模型多大的自由里。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10