ARC-AGI-3榜单剧变:Kaggle分数30天内从7%飙升至56%

Kaggle限制小模型的ARC-AGI-3竞赛中,30天内最高分从7%飙升至56%,推理框架功不可没。
过去一个月,Kaggle平台上ARC-AGI-3基准的最高分从7%跃升至56%,而这一成绩由受限使用小型本地模型的参赛者取得,并非依赖超大闭源模型的算力堆砌。ARC-AGI由François Chollet设计,专门用于测试极少样本下的抽象推理与模式泛化能力,历来被视为彰显人类认知优势的"反AI"基准。此次分数暴涨的核心驱动力在于推理脚手架(harness)的工程突破——通过精心设计的问题分解、候选解生成、自洽验证与迭代收敛流程,同一基础模型的表现可以产生质的飞跃。这一事件表明,抽象推理任务的瓶颈并不完全在于参数规模,同时也在侵蚀ARC-AGI作为"通用智能试金石"的护城河,倒逼基准设计者推出更抗过拟合的下一代测试。
一个月内发生了什么
ARC-AGI系列基准一直被视为衡量机器"通用智能"的试金石,其设计初衷就是展现人类相对于AI的推理优势。然而在过去30天里,Kaggle平台上ARC-AGI-3的最高分从7%一路攀升到56%,这一跳跃幅度在同类基准的历史上相当罕见。
根据Reddit社区发布的榜单信息,这一变化尤其值得玩味的地方在于:Kaggle竞赛对参赛者使用的模型有严格限制,选手只能调用体量较小的本地模型(local models),而非动辄数千亿参数的闭源大模型。换句话说,推动分数暴涨的并非算力军备竞赛,而是模型调度框架(harness)与方法层面的突破。
![reddit source: Top ARC-ΑGI-3 scores on Kaggle just went from 7% to 56% [N]](/media/screenshots/source/33743_0.png)
为什么这个数字重要
ARC-AGI(Abstraction and Reasoning Corpus)由François Chollet提出,核心理念是测试系统在极少样本下进行抽象推理和模式泛化的能力——这正是传统深度学习模型最薄弱的环节。基准被刻意设计成"对人类简单、对机器困难",用以凸显人类认知的独特性。
ARC-AGI-3作为该系列的新版本,延续了这一哲学。因此当Kaggle上的小模型在短时间内把分数推到56%,意味着这些受限模型在harness的组织下,已经开始在一项"为证明人类优越性而设计"的任务上逼近甚至超过普通人的平均表现。发帖者敏锐地指出了这个反差:不是最强模型,而是"小而本地"的模型做到了这一点。
ARC-AGI基准的题目形式值得专门说明。每道题由若干输入-输出网格对组成(通常3-5个示例),系统需要从这些极少的示例中归纳出变换规则,再将规则应用到新的输入网格上。网格由彩色方块构成,变换规则可能涉及旋转、镜像、对称填充、颜色映射等抽象模式。这类任务对人类来说凭直觉即可完成,却长期令大型语言模型束手无策——原因在于规则从不重复,每道题都是"一次性知识",无法靠记忆训练数据中的类似案例来作弊。正因如此,ARC-AGI长期被视为衡量"流体智能"(fluid intelligence)而非"晶体知识"(crystallized knowledge)的工具,在AI能力评估体系中占据独特地位。
Harness的作用被低估了
这场跳跃最有启发性的一点,是它把聚光灯打到了"harness"——也就是围绕模型构建的推理脚手架上。同一个基础模型,在裸调用和经过精心设计的提示、搜索、验证、迭代流程包裹之后,表现可能天差地别。
在Kaggle的约束条件下,参赛者无法靠换更大的模型取胜,只能在推理策略上做文章:如何分解问题、如何生成候选解、如何自我校验、如何在多次尝试中收敛到正确答案。56%这个结果某种程度上证明了,抽象推理任务的瓶颈并不完全在模型参数规模,而在于我们如何编排模型的思考过程。
推理脚手架(harness)在当前AI工程实践中通常包含几个关键模块:提示工程(将问题转化为模型易于处理的格式)、程序化搜索(生成多个候选解并系统性探索解空间)、自洽验证(让模型检查自身输出是否满足题目约束)、以及迭代精化(根据验证反馈修正答案)。在ARC-AGI场景下,一种常见策略是让模型生成多段描述变换规则的代码,再用代码执行结果反向验证规则的正确性——这相当于把抽象推理问题转化为程序合成问题。这种"思考-执行-验证"的闭环,使得模型不再依赖单次前向推理,而是通过多步迭代逼近正确答案,这也解释了为何框架设计能带来如此显著的分数提升。
需要保持的审慎
热度之外也要留一分清醒。发帖者本人就提醒,榜单配图"有点过时",具体数字可能存在滞后或口径差异。单一来源的社区爆料,终究需要官方榜单和可复现的提交记录来佐证。
此外,基准分数的跃升是否等同于"真正的通用推理能力",仍存在争议。基准一旦公开并被反复攻关,就可能出现针对性过拟合——选手摸清了题目分布的规律,而未必对应底层的泛化智能。56%也还远没到饱和,距离顶尖人类水平和满分都有不小空间。
这对行业意味着什么
无论最终解读如何,这一事件至少传递了两个信号。其一,小模型加上聪明的工程编排,正在不断蚕食曾被认为需要超大模型才能触及的能力边界,这对成本敏感的落地场景是利好。其二,ARC-AGI作为"反AI"基准的护城河正在被侵蚀,这会倒逼基准设计者推出更难、更抗过拟合的新一代测试。
对于关注AGI进展的从业者来说,与其纠结于某个具体百分比,不如关注分数曲线的斜率——30天从7%到56%的陡峭上升,本身就是比绝对数值更值得警惕也更值得兴奋的信息。
相关推荐

付费用户因"网络滥用"遭ChatGPT封号:1分钟秒拒的申诉机制引众怒
一名付费ChatGPT用户因"网络滥用"被无预警封号,三次申诉均在一分钟内被机器人驳回,全程无人工审核。本文梳理事件经过、可能的误判原因,并剖析AI平台自动化治理的申诉困境与开发者应对建议。

OpenSOP:用Git管理多语音Agent提示词的开源方案
OpenSOP 是一个开源工具,用 Git、YAML 和 Markdown 管理多个AI语音Agent的提示词,解决提示词重复、漂移和手动同步难题,支持改动影响预览和一键回滚。
AI代购时代来临:Shopify开放Agent结账,抢占万亿新市场
AI代购时代来临:Shopify开放Agent结账,抢占万亿新市场
Shopify开放AI代理结账功能,允许Agent读取、更新并提交订单。本文解析AI代购时代的平台分化、结构化数据的重要性与agent-assisted安全机制,并给出商家应对策略。