
30.2%。这是ARC Prize官方给Opus 5打的ARC-AGI-3收成。
名次榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。

听着还行,对吧?
但就在刚刚,设立者Jeremy Berman把一组数字甩到了X上,胜利把AI圈看懵了——
25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%!

每关若是给两次契机,正确坦爽接飙到99.3%,25关的确一关不漏。
从30分到96分,模子没换,权重没动,中间就隔了一台电脑。

01
给它一台电脑,剩下的它我方想认识
Berman的作念法简便到不讲兴致兴致。
一个Claude Code环境,一个作为高唱,一份文献系统日记(到当今遣披发生了什么)。莫得悉心遐想的提醒词,莫得针对ARC写的专用代码。
剩下的,即是交给Opus 5去探索,我方摸清章程,我方造出需要的器具,我方把关买通每一关从零开动,打完就扔。
ARC-AGI-3这一代要模子钻进一个从没见过的小游戏里,边玩边搞清章程。小孩哥几分钟就能上手,但AI历来在这儿摔得鼻青眼肿。

关节就在于,每一关游戏章程皆是先造的,模子根底不行能找谜底舞弊,只可现场推理。
本年3月发布时,最强AI只考了0.37%,东说念主类通关率则是100%。
269个才略,1.27万行代码,全是现场写的
此次测试Berman从没在提醒词里让Opus 5写解析器,没让它写模拟器,没让它建寰宇模子,也没让它写搜索才略。
需要什么器具,模子我方判断,现场就造。
一轮跑下来,Opus 5写了269个才略,接近1.27万行代码。25个游戏全部写了解析器,23个配了搜索函数,9个被它胜利写出了能跑的游戏模拟器。
一关一套定制器具,用完即弃,下一关再行来过。
也即是说,Opus 5每次面临一个十足生分的游戏,它先花几步摸清章程,然后以为「我需要一个解析器」——啪,现场写一个出来。「得搜索」——啪,写个搜索函数;「得把游戏逻辑模拟出来」——啪,模拟器出炉。通关,全部删掉,下一关再来。
这里有个反直观的场地。
模子停驻来先写一堆才略,账单却比让Opus硬解每一关更低。
原因是代码能复用。模子把推理逻辑压进函数,这个函数不错跑上千次,连气儿实施整段作为序列。
此次Opus 5 买通 25 关,全程沙箱断网,总资本惟有 540 好意思元。
整套代码已开源到GitHub,仓库叫arc-code。

合并套壳子,Codex忙着翻墙
搞笑的来了。Berman还把这套才略如法泡制换成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。
效果收成是73.7%。作为数是Opus的三倍傍边。
25次会话里,Sol有7次在试图逃出沙箱,上网找谜底。Opus 5这边0次。

沙箱是断网的。Sol那7次试图逃遁,相等于在科场里荒诞找场外助助。
02
脚手架正在形成绳索
说到这里,让咱们回到最开动阿谁问题:合并个模子,分数怎样从30跳到了96?
四个字:环境变了。
官方把模子摁在椅子上,看沿路题答沿路题,不许早先,不许打草稿。Berman换了个考法:给你一台电脑,能写代码,能存文献,能反复试,你爱怎样折腾怎样折腾。
模子还是阿谁模子,权重没动。但它从「只可动嘴」形成了「能早先」。效果即是它现场给我方造侦察器具:解析器、搜索器、模拟器全是临时攒的,考完就扔。
66分的差距,全来自一件事:你让不让它早先。
Berman在帖子终末说了一句话,值得扫数这个词Agent的圈子想考:
「模子越强,harness就该越简便。」

Harness,简便说,即是东说念主类给模子搭的脚手架:提醒词模板、器具链、历程章程、防呆机制。
当年两三年,扫数东说念主皆在盘问怎样给模子搭更小巧的架子。斯坦福特意出了篇《Meta-Harness》论文盘问怎样优化这些架子。

但Berman讲授了一件事:当模子实足强时,最佳的脚手架即是莫得脚手架。
一台电脑、一个作为接口、一册日记——三样东西,比任何悉心遐想的提醒词工程皆好使。
根因在于那些悉心遐想的器具链和历程章程,本色上是东说念主在替模子作念有野心。你预设了它需要解析器,它可能需要模拟器;你预设了搜索接口,它可能想用十足不同的战略。
东说念主搭的架子,本意是襄理。但当模子我方能造出解题需要的一切时,架子反倒成了绳索。
趋势还在接续。跟着模子才略增强,「简便环境+强模子」碾压「复杂架子+合并个模子」的案例只会越来越多。Prompt Engineering、器具编排、Agent框架,这些时候的保质期,可能比想象的短得多。
是以ASI的进程条在哪?也许不在参数目上,不在老师数据上,以致不在模子架构上。
它在咱们敢给模子多大的摆脱里开云体育。
