[控场AI]
基准ARC-AGI-2

ARC-AGI

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由François Chollet提出的人工智能推理能力基准测试,旨在评估AI系统的抽象推理与泛化能力。该基准通过一组视觉图形变换任务,要求模型从少量示例中归纳规律并推断答案,强调考察类人的核心知识推理,而非依赖大规模记忆或统计学习,是衡量通用人工智能进展的重要参考标准之一。

核心事实

时间轴 (近 90 天)

10月9日

ARC-AGI基准旨在区分「在见过的任务上表现好」与「能灵活应对全新结构性问题」两种能力

待验证50%
10月8日

在ARC-AGI基准上,同一个模型仅靠不同的Harness设计,成绩可以从30%跃升到95%甚至100%

待验证50%
10月8日

加上适当的Harness后,Prime Agent在ARC-AGI上做到了95%

待验证50%
10月8日

Prime Agent在ARC-AGI上用GPT系列拿到约78%,用Opus拿到95.5%

待验证50%
10月8日

Claude Opus在ARC-AGI私有holdout集上原生验证的最佳成绩是30%

待验证50%
10月4日

ARC-AGI每道题由若干输入-输出网格对组成(通常3-5个示例),系统需从中归纳变换规则并应用到新输入网格

待验证50%
10月4日

基准一旦公开并被反复攻关,可能出现针对性过拟合,即摸清题目分布规律而未必对应底层泛化智能

待验证50%
10月4日

在ARC-AGI场景下,一种常见策略是让模型生成描述变换规则的代码,再用代码执行结果反向验证规则,将抽象推理转化为程序合成问题

待验证50%
10月4日

ARC-AGI的变换规则从不重复,每道题都是一次性知识,无法靠记忆训练数据中的类似案例作弊

待验证50%
10月4日

ARC-AGI基准被刻意设计成对人类简单、对机器困难,用以凸显人类认知的独特性

待验证50%

还有 27 条时间轴事件

全部知识事实 (20)

已验证

ARC-AGI是由AI安全研究员François Chollet设计的专门测量流体智能的基准测试

85%
已验证

François Chollet强调抽象推理和泛化能力,提出了ARC基准测试作为衡量标准

80%
已验证

ARC-AGI由AI安全研究员François Chollet于2019年提出

80%
已验证

ARC-AGI专门测量流体智能,而传统大语言模型主要展现晶体智能

75%
已验证

在 ARC Prize 的标准框架下,GPT-6 Astra 的 ARC-AGI-3 成绩只有 62.7

65%
已验证

ARC-AGI基准由François Chollet于2019年提出,用于评估AI在面对全新问题时的抽象推理和泛化能力

65%
已验证

ARC-AGI由AI研究者François Chollet设计,用于创造对人类直觉简单但对依赖数据记忆的语言模型极为困难的测试集

65%
待验证

ARC-AGI的每道题由彩色网格构成,要求模型从2-3个输入输出示例中归纳出变换规则再应用到新输入上

95%
待验证

ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%

80%
待验证

公开基准测试一旦被广泛关注,就有被针对性优化的风险,高分未必反映泛化的推理能力

60%
待验证

ARC-AGI基准旨在区分「在见过的任务上表现好」与「能灵活应对全新结构性问题」两种能力

50%
待验证

Prime Agent在ARC-AGI上用GPT系列拿到约78%,用Opus拿到95.5%

50%
待验证

Claude Opus在ARC-AGI私有holdout集上原生验证的最佳成绩是30%

50%
待验证

加上适当的Harness后,Prime Agent在ARC-AGI上做到了95%

50%
待验证

在ARC-AGI基准上,同一个模型仅靠不同的Harness设计,成绩可以从30%跃升到95%甚至100%

50%
待验证

基准一旦公开并被反复攻关,可能出现针对性过拟合,即摸清题目分布规律而未必对应底层泛化智能

50%
待验证

ARC-AGI基准被刻意设计成对人类简单、对机器困难,用以凸显人类认知的独特性

50%
待验证

ARC-AGI每道题由若干输入-输出网格对组成(通常3-5个示例),系统需从中归纳变换规则并应用到新输入网格

50%
待验证

ARC-AGI的变换规则从不重复,每道题都是一次性知识,无法靠记忆训练数据中的类似案例作弊

50%
待验证

在ARC-AGI场景下,一种常见策略是让模型生成描述变换规则的代码,再用代码执行结果反向验证规则,将抽象推理转化为程序合成问题

50%

来源文章