ARC-AGI-3
由François Chollet设计的AI基准测试,通过视觉图案规律推理评估模型泛化推理能力而非记忆能力,被视为衡量AI接近通用智能程度的重要参照,ARC-AGI-3为2025年推出的最新难度版本
核心事实
时间轴 (近 90 天)
发帖者提醒榜单配图有点过时,具体数字可能存在滞后或口径差异
ARC-AGI-3的56%分数距离顶尖人类水平和满分还有不小空间
推动ARC-AGI-3分数暴涨的是模型调度框架(harness)与方法层面的突破,而非算力规模
Kaggle竞赛对参赛者使用的模型有严格限制,选手只能调用体量较小的本地模型
在过去30天里,Kaggle平台上ARC-AGI-3的最高分从7%攀升到56%
ARC-AGI-3是由François Chollet设计的推理能力基准,检验AI在从未见过的任务规则中的泛化推理能力,专门对抗暴力记忆
人类玩家完成一局ARC-AGI-3游戏所消耗的能量按零售电价折算成本不到0.1美元
ARC-AGI-3是ARC-AGI系列的最新版本,难度进一步提升
名为Astra的系统完成同一局ARC-AGI-3游戏成本高达300到400美元
在 ARC Prize 的标准框架下,GPT-6 Astra 的 ARC-AGI-3 成绩只有 62.7
还有 18 条时间轴事件
全部知识事实 (20)
在 ARC Prize 的标准框架下,GPT-6 Astra 的 ARC-AGI-3 成绩只有 62.7
65%已验证GPT-6 Astra在ARC-AGI 3基准测试中使用OpenAI自定义的Provider Adapter框架取得99.9%的分数,成本为1.9万美元
65%待验证ARC-AGI-3的关键升级在于引入了交互式推理,智能体需要在动态环境中通过多轮探索、试错、反馈逐步逼近正确解法
60%待验证Claude Opus 5在ARC-AGI-3上得分30.2%,而上一代仅1.5%
60%待验证发帖者提醒榜单配图有点过时,具体数字可能存在滞后或口径差异
50%待验证在过去30天里,Kaggle平台上ARC-AGI-3的最高分从7%攀升到56%
50%待验证Kaggle竞赛对参赛者使用的模型有严格限制,选手只能调用体量较小的本地模型
50%待验证推动ARC-AGI-3分数暴涨的是模型调度框架(harness)与方法层面的突破,而非算力规模
50%待验证ARC-AGI-3的56%分数距离顶尖人类水平和满分还有不小空间
50%待验证ARC-AGI-3是由François Chollet设计的推理能力基准,检验AI在从未见过的任务规则中的泛化推理能力,专门对抗暴力记忆
50%待验证人类玩家完成一局ARC-AGI-3游戏所消耗的能量按零售电价折算成本不到0.1美元
50%待验证ARC-AGI-3是ARC-AGI系列的最新版本,难度进一步提升
50%待验证ARC-AGI-3不再局限于输入网格、输出网格的静态任务形式,而是引入更接近智能体行为的动态环境测试
50%待验证审慎派认为攻克ARC-AGI-3可能需要架构层面的根本性突破而非单纯的参数规模堆叠
50%待验证在ARC-AGI-3基准上,同一个GPT-5.6模型仅更换Codex Harness两个配置项,得分从13.3%提升到38.3%,输出token降低六倍
50%待验证交互式推理测试要求智能体具备环境理解、计划制定和动态调整三种能力的协同
50%待验证Chollet团队持续发布ARC-AGI新版本(如ARC-AGI-2、ARC-AGI-3)以增加难度和多样性
50%待验证ARC-AGI-3相较于前代版本的核心创新在于引入了交互式推理
50%待验证在ARC-AGI-3中,系统可以提交试探性答案并获得反馈,从而在多轮迭代中逐步优化解答
50%待验证在完全相同的模型下,仅靠Harness策略优化,ARC-AGI-3得分从13.3%提升到38.3%,同时输出Token节省约六倍
50%