ARC-AGI-3近乎被攻克:编程能力如何解锁AI通用智能

一条推文引发的思考
近日,一条关于 ARC-AGI-3 基准测试的推文在AI社区引发广泛讨论。推文指出:仅仅通过为大语言模型(LLM)添加一个「编程框架」(coding harness),ARC-AGI-3 就几乎被攻克了。 发帖者进一步强调,这印证了此前的一个预测——编程能力能够帮助LLM实现能力泛化(coding generalizes LLMs)。
这一观点虽然简短,却触及了当前AI研究中最核心的议题之一:大模型究竟如何获得真正的通用推理能力?以及,代码在其中扮演了怎样的关键角色?

ARC-AGI是什么,为何它如此重要
一个专为通用智能设计的试金石
ARC(Abstraction and Reasoning Corpus)由深度学习研究者 François Chollet 提出,其设计初衷是衡量AI系统的抽象与推理能力,而非记忆能力。Chollet是Keras深度学习框架的创建者,也是Google的高级研究员。他在2019年发表了极具影响力的论文《On the Measure of Intelligence》,系统性地批评了当时AI基准测试的局限性——这些测试往往只衡量模型在特定任务上的技能水平,而非真正的智能。Chollet提出,智能应该被定义为「在面对新颖情境时的泛化效率」,即系统利用有限经验适应全新问题的能力。ARC正是基于这一理论框架设计的。
与传统基准不同,ARC 的任务对人类而言相对直观——通过观察少量输入输出示例,推断出隐含的转换规则——但对AI系统却极具挑战性。具体来说,ARC的每道题目由若干「演示对」(demonstration pairs)和一个「测试输入」组成。演示对展示了某种视觉变换规则——例如将网格中特定颜色的区域旋转、镜像、填充、计数或按照某种拓扑关系重组。测试者需要仅凭这几个演示推断出底层规则,并将其应用到测试输入上生成正确输出。这些网格通常很小(最大30×30),颜色种类有限(10种),但变换规则的多样性几乎无穷。人类平均可以解决约85%的ARC任务,而在没有特殊框架辅助的情况下,即使是最强的LLM也长期徘徊在较低分数。
ARC-AGI 系列被视为检验模型是否具备「类人泛化能力」的重要标尺。长期以来,纯粹依赖模式匹配和海量数据训练的LLM在这类任务上表现平平,因为这些任务要求模型在从未见过的问题上进行真正的推理,而不是复现训练数据中的既有解法。每道题都是独特的,不存在可以通过大量练习来「刷」的题型,从而最大限度地排除记忆和模式匹配的影响。
从ARC-AGI-1到ARC-AGI-3的演进
随着模型能力的提升,ARC 基准也在不断迭代升级,难度逐步加大。ARC Prize是由Chollet联合创办的竞赛项目,旨在推动通用AI推理能力的突破,2024年的ARC Prize悬赏100万美元给能在ARC-AGI上达到85%准确率(人类水平)的解决方案。在竞赛历史中,早期最佳方案多依赖领域特定语言(DSL)搜索——预先定义一组基本操作(如旋转、平移、颜色替换等),然后搜索这些操作的组合来拟合演示对。后来,结合LLM的混合方案开始占据主导地位,尤其是让LLM生成候选程序再通过搜索验证的方法。
ARC-AGI-3 作为最新一代测试,被设计用来对抗那些能够「刷分」的强大模型,进一步逼近对真正通用推理能力的检验。ARC-AGI-2和ARC-AGI-3的推出正是为了应对日益强大的解决方案,确保基准仍然能有效区分真正的推理能力与巧妙的工程优化。因此,「ARC-AGI-3 近乎被攻克」这一说法一旦成立,其意义将不容小觑。
编程框架为何能带来推理突破
代码作为推理的脚手架
这里的核心洞察在于「coding harness」(编程框架)的引入。所谓编程框架,是指让LLM不再直接「猜测」答案,而是通过编写代码来解决问题——将抽象的推理任务转化为可执行、可验证的程序逻辑。
具体而言,coding harness的核心思路是让LLM生成Python程序来描述从输入到输出的转换逻辑,而非直接预测输出网格的像素值。典型流程包括:模型观察输入输出示例,分析可能的变换规则,然后编写一个transform函数;该函数被实际执行在演示输入上,检查输出是否与演示答案一致;如果不一致,模型会获得错误反馈并迭代修改代码。这种方法的关键优势在于引入了「执行验证循环」——代码要么正确运行产出预期结果,要么报错,不存在模糊的中间地带。这让推理过程变得可调试、可追溯。
这一方法的价值体现在几个层面:
- 结构化推理:代码天然要求逻辑严谨、步骤清晰。当模型被引导用编程方式思考时,它必须将模糊的直觉转化为精确的操作序列。
- 可验证性:程序可以被执行并检验结果,模型能够根据反馈迭代修正,而非一次性输出。
- 组合泛化:编程本质上是将简单操作组合成复杂逻辑的过程,这正好契合 ARC 任务所要求的「从少量示例推断通用规则」的能力。
代码泛化LLM能力的深层逻辑
推文中「as predicted, coding generalizes LLMs」的表述,呼应了近年来AI研究中一个日益获得共识的观点:在代码数据上训练、以编程方式引导推理,能够显著提升模型在非编程任务上的通用能力。
近年来的研究为这一观点提供了充分的实证支持。Meta等机构的研究论文表明,即使是纯自然语言任务(如数学推理、逻辑推断),经过代码预训练的模型也优于纯文本模型。原因在于代码具有天然的形式化特征:变量定义要求概念明确化,控制流要求逻辑显式化,函数抽象要求问题分解化。此外,代码的「正确性可验证」特性也为训练信号提供了天然的奖励机制,这在强化学习从人类反馈(RLHF)之外开辟了新的对齐路径。OpenAI、Google DeepMind等机构都已将代码能力视为通向AGI的关键组成部分。
这背后的逻辑是,代码不仅是一种技能,更是一种思维模式的载体。编写代码需要抽象、分解、递归、条件判断等能力,而这些恰恰是通用推理的基础构件。因此,当模型掌握了「用代码思考」的方式后,它在数学、逻辑、规划等广泛领域的表现都会随之提升。
从工具使用到程序合成的范式演进
LLM与代码的结合经历了几个清晰的阶段。最初是「工具调用」(tool use),如让模型调用计算器或搜索引擎来弥补自身的计算短板;随后发展为「代码解释器」(code interpreter),模型可以编写并执行代码来处理数据分析、文件操作等任务,OpenAI的Code Interpreter功能是这一阶段的标志性产品;现在则进一步演进为「程序合成」(program synthesis),即模型通过生成程序来表达和验证其推理过程。
这一范式的核心转变在于:推理不再是模型内部的黑箱过程,而是被「外化」为可检查的程序。这不仅提升了准确性,也极大增强了可解释性——我们可以直接阅读模型生成的代码来理解它的推理逻辑。ARC-AGI-3上的突破正是这一范式演进的最新成果。
这一发现对AGI研究意味着什么
通向通用人工智能的一条可能路径
如果「加一个编程框架就能近乎攻克 ARC-AGI-3」的结论经得起严格检验,那么它传递出一个重要信号:通用推理能力或许不需要全新的模型架构,而是可以通过恰当的「引导方式」从现有LLM中激发出来。
这与「模型本身已具备潜在推理能力,只是需要正确的框架来释放」的假设相符。换言之,突破口可能不在于把模型做得更大,而在于设计更聪明的推理与验证机制——让模型「先编程、再执行、后修正」。这种「外部化思考」的方式,某种程度上类似于人类使用纸笔、图表等外部工具来辅助复杂推理的行为,是一种认知卸载(cognitive offloading)的策略。
需要保持的审慎态度
当然,作为一条来自社交媒体的简短论断,其中仍有诸多细节有待厘清:
- 「近乎攻克」的具体分数是多少? 与人类基准和此前模型相比提升了多少?
- 编程框架的具体实现是怎样的? 是端到端的自动化流程,还是包含大量人工设计的提示与工具?
- 是否存在过拟合基准的风险? ARC 的意义在于测试泛化,若解法针对性过强,反而可能背离其初衷。
- 计算成本如何? 如果需要大量的代码生成-执行-修正循环,其推理时计算量(inference-time compute)可能远超直接预测,这在实际部署中是否可行?
在缺乏完整论文与可复现数据的情况下,我们应将这一说法视为一个值得关注的方向性信号,而非已被盖棺定论的结论。
结语
这条推文虽短,却浓缩了当前AI发展的一个关键趋势:代码正在成为大模型走向通用智能的核心杠杆。 从代码预训练到工具调用,再到如今用编程框架攻克抽象推理基准,我们看到的是一条清晰的脉络——让模型学会像程序员一样思考,或许正是通往更强通用能力的重要路径。
无论 ARC-AGI-3 是否真的「近乎被攻克」,这一探索本身都提醒我们:AI能力的边界,往往不只取决于模型的规模,更取决于我们如何引导它去思考和解决问题。代码作为人类最精确的思维表达工具之一,正在成为释放AI潜能的关键钥匙。
相关推荐

遗传算法+神经网络:登机效率超越Steffen法9.6%
Reddit开发者用遗传算法结合多层感知机(MLP)优化飞机登机顺序,在模拟中实现比Steffen方法快9.6%的登机效率。本文拆解其技术思路、实际意义与局限性。

DeepSeek V4 Pro与Grok 4.6同日发布:AI大厂Agent之战全面打响
DeepSeek V4 Pro、Grok 4.6、腾讯混元WorldCloud、阿里万亿开源模型同日发布,Agent能力成主战场,价格战全面开打。深度解析四大发布的核心亮点与产业趋势。

Gmail点号忽略机制为何导致邮件误送给同名用户
解析Gmail地址容错机制如何导致邮件误送问题。深入分析点号忽略、大小写归一化等设计特性,探讨同名用户频繁收到他人邮件的根源及应对策略。