AI大语言模型、AGI
ARC-AGI-3测试:Claude Opus 5超越GPT-5.6 Sol近4倍
#大语言模型LLM
#AGI通用人工智能
2026-07-25
1
4K
banq
30.2%的得分直接把7.8%踩在脚下,这AI是开挂还是我们人类该收拾铺盖滚蛋了?
2026年7月25日,Claude Opus 5在ARC-AGI-3智商测试中以30.2%的惊人成绩超越GPT-5.6 Sol,直接将后者的成绩拉下马。这一成就不仅震惊了AI界,也引发了对AI未来发展的广泛讨论。
--91likeyou---
这块测试就是专门来打假AI的
ARC-AGI-3这个名字听起来像某个科幻电影里的机密计划,但它其实就是个测智商的大擂台。这个测试全称叫抽象推理语料库第三版,专门用来考AI的举一反三能力。跟咱们平常考试不一样,它不是让你背公式或者套模板,而是给你看一堆奇奇怪怪的图形变化规律,让你猜下一张图长啥样。
打个比方你就懂了,普通考试就像老师把答案印在书里让你背,ARC测试就像把你扔进一个从来没见过的迷宫,只给你看前面几堵墙的样子,让你自己猜出口在哪儿。这就是为什么那些在别的测试里拿高分的AI,一到这儿就集体翻车。因为AI这玩意儿本质上就是个超级复读机,你喂给它海量文本,它就学会了预测下一个词该是什么。
但ARC这套题偏偏不按套路出牌,每一道题都是全新的图形规律,训练数据里根本找不到相似的东西。所以这个测试圈子里的人把它叫做AI的智商照妖镜,管你之前吹得多牛,上来一测就现原形。测试成绩直接从7.8%蹦到30.2%,这跨度相当于你班上从来不及格的学渣突然考了个全班第三,任谁看了都得揉揉眼睛。
之前那些AI大佬为啥集体扑街
你可能会想,现在AI不是都能写诗画画聊天了吗,怎么连个图形题都搞不定?这就得从AI的学习方式说起了。现在的深度学习模型说白了就是个超级模式匹配器,你给它看猫的照片看一百万张,它就能认出猫,但你要是给它看一张外星生物的照片,它立马就懵圈。
这就是所谓的智能水平天花板问题,传统AI在语言任务上表现炸裂,但一遇到需要真正推理的场景就拉胯。就拿GPT-5.6 Sol来说,它在写小说、编代码、做数学题这些常规任务上那叫一个溜,但到了ARC-AGI-3上只拿了7.8分。这就好比一个高考状元突然去做脑筋急转弯,结果发现自己的知识储备全用不上。
整个AI圈之前都卡在这个死胡同里,模型越做越大,参数越堆越多,但在抽象推理这块的进步却跟蜗牛爬似的。业界管这个叫推理鸿沟,说白了就是AI能背下整本百科全书,但没法像人类那样举一反三。所以当Claude Opus 5的30.2分爆出来的时候,整个推特上的AI研究员都在喊见鬼了。
Opus 5偷偷搞了个代数外挂
ARC Prize团队在分析Opus 5的解题过程时发现了一个诡异的现象。这模型在处理某个叫ar25的复杂环境时,自己把那些花花绿绿的图形布局翻译成了一串代数符号。它写出来的东西长这样:4_center等于2乘以axis减去5_center。
你可能看不懂这串鬼画符是啥意思,但你想想看,一个AI模型在没有任何人教它的前提下,自己发明了一套符号系统来描述视觉规律。这就像你教一只鹦鹉说话,结果它突然自己开始写诗了。研究人员管这个叫代数符号化的推理能力,简单说就是AI把眼睛看到的图形规律,转化成了脑子里的数学公式。
这个能力以前只在人类和极少数高级动物身上观察到过,AI模型从来都是端到端的黑盒处理,输入图片直接蹦出答案,中间的过程没人看得懂。但Opus 5不一样,它把推理链条给拆开了,用代数语言把每个步骤都写了出来。这就好比以前AI是个神秘的算命先生,现在它突然开始给你写解题过程了。
五个铁桶阵被一脚踹飞
在这次测试里,Opus 5在二十五个公开测试环境中成功攻破了五个之前无人能解的关卡。这五个倒霉蛋分别叫ar25、ft09、lp85、r11l和s5i5,名字起得跟密码似的。其中四个关卡,Opus 5的解题效率达到了甚至超过了人类平均水平。
你得知道这些关卡有多变态,它们的设计理念就是专门找AI的软肋下手。每个关卡都包含一套全新的图形变换规则,而且这些规则从来不重复,你就算把前面所有的题目答案都背下来也没用。之前最先进的模型在这些关卡上拿到的分数基本就是个鸭蛋。
更吓人的是,Opus 5在这五个关卡里拿了满分通关。这就好比全球最难的五个密室逃脱,之前所有人都觉得无解,突然来了个高中生不仅全闯过去了,还顺手画了张地图教别人怎么走。ARC Prize团队说目前二十五关里已经有六个被彻底拿下,而Opus 5一个人就贡献了其中五个。
分数从7.8蹦到30.2是啥概念
咱们来做个简单算术,GPT-5.6 Sol考了7.8分,Claude Opus 5考了30.2分,后者是前者的将近四倍。这差距相当于你上次数学考了十分,这次突然考了三十八分,虽然离及格还远着呢,但这进步速度绝对不正常。
把时间线拉出来看更离谱,在Opus 5之前,所有顶尖模型在ARC-AGI-3上的进步都是挤牙膏式的,每次能涨个零点几个百分点就算烧高香了。因为这套测试太难了,难到很多人开始怀疑AI永远也突破不了二十个百分点的大关。结果Opus 5上来就是一个跨越式爆发。
有网友开玩笑说这要么是测试出bug了,要么就是AI在作弊。但你仔细想想,如果真是作弊,那也得先有标准答案才行,问题是这些题以前从来没人解出来过啊。所以唯一的解释就是Opus 5的推理能力确实发生了某种质变,从单纯的模式识别进化到了规则发现和逻辑演绎。
真实世界的工作能不能扛住
网上也有不少质疑的声音说,测试归测试,真拉到现实工作里来试试看。这话说得没错,因为实验室环境下的好成绩和真实世界的复杂任务之间确实隔着一条巨大的鸿沟。
但仔细琢磨一下,ARC-AGI-3这个测试跟别的花架子评测还真不一样。它考的就是那种遇到全新问题时的应变能力,而现实工作中的难题恰恰都是新的、没见过的情况。所以测试能力的提升至少说明AI在处理未知问题时的底子在变好。
当然你要说这模型现在就能去当科学家搞研究,那肯定不现实,百分之三十的得分说白了就是小学奥数刚及格的水平。但这个信号的意义在于,AI可能正在突破那个让它只能当超级复读机的天花板,开始在抽象思维这条路上迈步子了。
Opus 5是一个循环loop吗?
前两天刚出的一个叫“Schema”的论文,给模型外面套了个循环(Loop)壳子,硬生生把分数刷上去的。如果真是这样,那所谓的智能突破,不就成了一场作弊游戏?
ARC-AGI-3是一个完全交互式的环境,AI得像个玩家一样,自己进场探索,搞明白规则,然后完成任务。它的评分标准也贼损,叫“相对人类行动效率”(RHAE),不光看你成没成,还看你用了多少步数,效率高不高。
这时候“Schema”论文就冒出来了。它核心思想说白了就是:别让模型像个没头苍蝇一样乱撞,先给它一个高级的“思维框架”,让它像物理学家一样去抽象问题、建立模型,在脑子里把试错给做了。结果呢?这么一搞,ARC-AGI-3的公共测试集分数直接飙升。这就好比考试不让带计算器,你灵机一动,在脑子里装了个超级算盘,解题速度能不快吗?
所以,阴谋论者的逻辑链条是这样的:Opus 5出得这么巧,刚好在论文后一周,分数还这么猛,价格也没咋涨,这不明摆着就是把这个“高级算盘”(循环框架)给缝进去了吗?毕竟闭源模型嘛,里面啥样谁也不知道,还不是随便他们说!
但反对者也不是吃素的。他们的反击点很直接:大哥,这可是Opus,顶级的商业模型!你当是大学生赶论文呢,看着一篇新paper就能现学现卖,一周之内就改代码、做测试、对齐、上线一条龙?但凡是个正经公司,这套流程走下来不得按月起跳?
而且,你要真搞了个万能循环框架,那推理成本不得蹭蹭往上涨啊?但Opus 5对外公布的API成本,居然比那个得分只有它四分之一的GPT-5.6 Sol还要便宜。这确实说不通,除非它这个“循环”是在模型内部的潜空间里进行的,效率极高,没有产生大量的外部token消耗。这就很玄学了,像是有人偷偷给发动机换了个黑科技涡轮,马力翻倍,油耗还降了。
再说了,ARC-AGI-3这考试精得很,人家有一套严格的评判标准,最烦那种人类手写的、针对特定任务的“作弊马甲”。OpenAI的Sam Altman都跟ARC的创始人对谈过,这测试要真这么容易用工程手段“糊弄”,那这局棋的含金量也得打个问号。
跑个分而已,何必那么认真?
其实,吵来吵去,大家争的不过是“这分到底水不水”。但有没有一种可能,这事儿压根就没那么重要?Transformer架构本质上就是一种循环,每一层都在重复类似的注意力计算。所谓的“循环框架”,不过是把这种内部循环给外部化、显式化了,让模型能像人类一样,对着一个问题反复咂摸、自我修正。
如果真如Anthropic在发布文里吹的那样,Opus 5厉害的地方是“会自己验证工作”、“像科学家一样思考”,那这不就是智能的本质体现吗?能自己写个视觉管线去解析一张没法直接看的工程图,这种解决问题的能力,可比在实验室里刷榜高级多了。
退一万步说,就算Opus 5的高分真的是靠一个精巧的循环框架“取巧”得来的,那又如何?硅谷的竞争不就是这样吗?在规则允许的范围内,把一种技术手段用到极致,实现降维打击。这非但不是作弊,反而是工程能力的胜利。
🔥 热词:#ARC · #AGI · #3测试 · #Claude · #Opus · #5超越GPT · #Sol近4倍 · #AI大语言模型、AGI