[控场AI]
基准ARC-AGI / Abstraction and Reasoning Corpus

ARC-AGI-3

由François Chollet设计的AI基准测试,通过视觉图案规律推理评估模型泛化推理能力而非记忆能力,被视为衡量AI接近通用智能程度的重要参照,ARC-AGI-3为2025年推出的最新难度版本

核心事实

时间轴 (近 90 天)

10月4日

发帖者提醒榜单配图有点过时,具体数字可能存在滞后或口径差异

待验证50%
10月4日

ARC-AGI-3的56%分数距离顶尖人类水平和满分还有不小空间

待验证50%
10月4日

推动ARC-AGI-3分数暴涨的是模型调度框架(harness)与方法层面的突破,而非算力规模

待验证50%
10月4日

Kaggle竞赛对参赛者使用的模型有严格限制,选手只能调用体量较小的本地模型

待验证50%
10月4日

在过去30天里,Kaggle平台上ARC-AGI-3的最高分从7%攀升到56%

待验证50%
9月29日

ARC-AGI-3是由François Chollet设计的推理能力基准,检验AI在从未见过的任务规则中的泛化推理能力,专门对抗暴力记忆

待验证50%
9月24日

人类玩家完成一局ARC-AGI-3游戏所消耗的能量按零售电价折算成本不到0.1美元

待验证50%
9月24日

ARC-AGI-3是ARC-AGI系列的最新版本,难度进一步提升

待验证50%
9月24日

名为Astra的系统完成同一局ARC-AGI-3游戏成本高达300到400美元

已过期50%
9月21日

在 ARC Prize 的标准框架下,GPT-6 Astra 的 ARC-AGI-3 成绩只有 62.7

已验证65%

还有 18 条时间轴事件

全部知识事实 (20)

已验证

在 ARC Prize 的标准框架下,GPT-6 Astra 的 ARC-AGI-3 成绩只有 62.7

65%
已验证

GPT-6 Astra在ARC-AGI 3基准测试中使用OpenAI自定义的Provider Adapter框架取得99.9%的分数,成本为1.9万美元

65%
待验证

ARC-AGI-3的关键升级在于引入了交互式推理,智能体需要在动态环境中通过多轮探索、试错、反馈逐步逼近正确解法

60%
待验证

Claude Opus 5在ARC-AGI-3上得分30.2%,而上一代仅1.5%

60%
待验证

发帖者提醒榜单配图有点过时,具体数字可能存在滞后或口径差异

50%
待验证

在过去30天里,Kaggle平台上ARC-AGI-3的最高分从7%攀升到56%

50%
待验证

Kaggle竞赛对参赛者使用的模型有严格限制,选手只能调用体量较小的本地模型

50%
待验证

推动ARC-AGI-3分数暴涨的是模型调度框架(harness)与方法层面的突破,而非算力规模

50%
待验证

ARC-AGI-3的56%分数距离顶尖人类水平和满分还有不小空间

50%
待验证

ARC-AGI-3是由François Chollet设计的推理能力基准,检验AI在从未见过的任务规则中的泛化推理能力,专门对抗暴力记忆

50%
待验证

人类玩家完成一局ARC-AGI-3游戏所消耗的能量按零售电价折算成本不到0.1美元

50%
待验证

ARC-AGI-3是ARC-AGI系列的最新版本,难度进一步提升

50%
待验证

ARC-AGI-3不再局限于输入网格、输出网格的静态任务形式,而是引入更接近智能体行为的动态环境测试

50%
待验证

审慎派认为攻克ARC-AGI-3可能需要架构层面的根本性突破而非单纯的参数规模堆叠

50%
待验证

在ARC-AGI-3基准上,同一个GPT-5.6模型仅更换Codex Harness两个配置项,得分从13.3%提升到38.3%,输出token降低六倍

50%
待验证

交互式推理测试要求智能体具备环境理解、计划制定和动态调整三种能力的协同

50%
待验证

Chollet团队持续发布ARC-AGI新版本(如ARC-AGI-2、ARC-AGI-3)以增加难度和多样性

50%
待验证

ARC-AGI-3相较于前代版本的核心创新在于引入了交互式推理

50%
待验证

在ARC-AGI-3中,系统可以提交试探性答案并获得反馈,从而在多轮迭代中逐步优化解答

50%
待验证

在完全相同的模型下,仅靠Harness策略优化,ARC-AGI-3得分从13.3%提升到38.3%,同时输出Token节省约六倍

50%

来源文章