Kimi-K3在ARC-AGI-2拿下60.4%:抽象推理能力突破解读

一条推文引发AI社区热议
近日,社交平台上一条简短的推文引发了AI社区的热烈讨论:Kimi-K3 在 ARC-AGI-2 基准测试上取得了 60.4% 的成绩。对于长期关注大模型推理能力的从业者来说,这个数字并不寻常——因为 ARC-AGI 系列一直被视为衡量AI「真正推理」而非「记忆背诵」的试金石。

需要说明的是,这一消息目前仅来自单一社交媒体来源,尚未得到官方权威榜单或论文的完整佐证。因此在下文的分析中,我们会将关注点更多放在「如果属实,这一成绩意味着什么」上,而非对具体分数做过度确定的论断。
ARC-AGI-2为什么被称为最硬核的推理基准
一个无法靠「刷题」攻克的测试
ARC(Abstraction and Reasoning Corpus)由 François Chollet 提出,设计初衷就是区分「模式记忆」与「抽象推理」。Chollet 不仅是这一基准的创造者,更是 Keras 深度学习框架的创始人和 Google 的 AI 研究员。他在 2019 年发表的重要论文《On the Measure of Intelligence》中系统阐述了自己对智能的定义:智能不是技能本身,而是获取技能的效率。
这一定义背后有深刻的理论支撑。Chollet 提出了一个关键区分:当前AI基准测试大多衡量的是「技能」(skill)而非「智能」(intelligence)。一个系统可以通过海量训练在国际象棋上超越人类,但这并不意味着它具有通用智能——因为它无法将这种能力迁移到其他领域。他借用算法信息论(Algorithmic Information Theory)的框架来形式化智能的定义:智能是一个系统在面对新问题时,利用有限先验知识高效获取新技能的能力。ARC 数据集正是基于这一理论设计的实验验证工具——它假设解题者具备人类婴儿级别的「核心知识」(如物体恒存性、基本几何关系),但不假设任何特定领域的专业知识,从而测试的是从极少示例中归纳新规则的能力。
这里值得深入理解的是,Chollet在设计ARC时借鉴了发展心理学中的「核心知识」(Core Knowledge)理论,该理论由哈佛大学心理学家Elizabeth Spelke等人提出,认为人类婴儿天生具备四类核心认知能力:物体性(objectness,即物体是有边界的、持久存在的)、能动性(agentness,即某些实体能自主行动)、数量(number,即对小数量的直觉理解)、以及基本几何(geometry,即对空间关系的感知)。ARC假设解题者拥有这些先验知识,但不假设任何通过后天学习获得的专业技能。这使得ARC成为一种「公平」的智能测试——它不偏向任何特定文化、教育背景或专业领域,而是测试最基础的认知泛化能力。
基于这一理论框架,他设计了 ARC 数据集——每道题由若干输入-输出网格对(通常 2-3 对)作为示例,要求解题者推断出隐含的变换规则并将其应用于新的输入。这些网格使用最多 10 种颜色,尺寸从 1×1 到 30×30 不等。关键在于,每道题的规则都是独一无二的,涉及对称、旋转、计数、拓扑关系等多种抽象概念的组合,使得纯统计学习方法几乎无法直接套用。
与常见的知识类基准(如 MMLU)不同,ARC 中的每一道题都是全新的抽象视觉推理任务,模型无法通过记忆训练数据中的答案来蒙混过关。
ARC-AGI-2 是这一系列的升级版本,进一步提高了任务的抽象难度,并强化了对「样本效率」和「泛化能力」的考察。具体而言,ARC-AGI-2 于 2024 年底至 2025 年初正式推出,相比初代做了几项关键升级:第一,任务复杂度显著提高,需要更多步骤的组合推理才能得出答案;第二,引入了更严格的评估协议,包括对计算预算的分级限制(如每道题的推理时间或 API 调用次数上限);第三,增加了更多需要「组合泛化」的题目——即需要同时理解多个独立概念并将它们组合应用。这使得即便是在初代 ARC 上表现不错的程序合成(program synthesis)方法,在 ARC-AGI-2 上也面临更大的挑战。
值得一提的是,在ARC竞赛的早期阶段,表现最好的方法往往不是端到端的神经网络,而是基于程序合成(program synthesis)的混合系统。这类方法的核心思路是:将每道ARC题目视为一个程序发现问题——系统需要从输入输出示例中搜索出一段能够将输入变换为输出的程序(通常用领域特定语言DSL表达)。代表性工作包括Hodel的手工规则系统、基于遗传算法的程序进化方法、以及结合神经网络做搜索引导的神经符号方法。然而这些方法的瓶颈在于搜索空间的组合爆炸:当变换规则涉及多步组合时,可能的程序空间呈指数级增长,纯搜索方法很快变得不可行。ARC-AGI-2的复杂度提升进一步放大了这一挑战。
值得特别说明的是,ARC-AGI-2 引入的分级计算预算制度是其评估体系的重要创新。在 ARC Prize 竞赛中,存在不同的赛道:公开榜单(Public Leaderboard)通常允许较多的计算资源,而正式竞赛赛道则对每道题的计算成本有严格限制(例如每道题不超过一定的 API 调用费用或 GPU 时间)。这一设计的意义在于:如果一个系统需要花费数万美元的计算资源来解一道人类几秒钟就能完成的题目,那么即便它答对了,也很难说它具备了「高效智能」。ARC Prize 基金会(由 Chollet 与 Mike Knoop 共同创立,设有 100 万美元大奖)明确将「计算效率」作为评判标准之一,这与 Chollet 对智能的定义一脉相承——智能不仅是能否解决问题,更是以多高的效率解决问题。
它的核心哲学是:真正的智能应该能够从极少的示例中归纳出规律,并应用到从未见过的新情境。
人类轻松完成,AI却举步维艰
在 ARC-AGI-2 上,普通人类的表现通常能达到较高水平,而绝大多数大语言模型的成绩长期徘徊在个位数到二十几个百分点之间。即便是一些顶尖的推理模型,突破 30%-40% 也颇为艰难。正因如此,60.4% 这个数字——如果准确——将是一个相当引人注目的跃升。
60.4%的成绩究竟意味着什么
抽象推理能力的实质性突破
如果 Kimi-K3 确实在 ARC-AGI-2 上达到 60.4%,这将表明模型在抽象推理和泛化能力上取得了实质性突破,而非仅仅在既有知识的检索上更强。这类成绩往往依赖于以下几方面的进步:
-
更强的链式推理(Chain-of-Thought)能力,能够在多步骤问题中保持逻辑一致。链式推理最初由 Google Brain 团队在 2022 年的论文中系统提出,核心发现是:当提示大语言模型在回答前先逐步展开推理过程时,模型在数学、逻辑和常识推理任务上的表现会大幅提升。此后这一技术快速演进:从手动编写思维链示例(few-shot CoT),到让模型自主生成推理步骤(zero-shot CoT),再到通过强化学习(如 RLHF/RLVF)直接训练模型产生更高质量的推理链。当前最先进的推理模型通常会生成数千甚至数万 token 的内部推理过程,在其中进行假设、验证、回溯和修正,形成类似人类深度思考的行为模式。
-
测试时计算(Test-Time Compute)的规模化利用,通过更多的推理步骤或采样来提升准确率。测试时计算是近年来大模型推理能力提升的核心策略之一。传统模型在推理时只进行一次前向传播(forward pass),输出即为最终答案。而测试时计算允许模型在回答问题时「花更多时间思考」,具体手段包括:生成多条推理路径后投票选择最优答案(self-consistency)、使用树搜索或 beam search 在解空间中探索、让模型反复修正自己的答案(self-refinement)、以及利用验证器(verifier)对候选答案进行打分筛选。OpenAI 的 o1/o3 系列就大量依赖这一策略,通过在推理阶段投入更多计算资源来换取准确率的提升。这也意味着同一个模型在不同的计算预算下可能表现迥异。
从更宏观的视角来看,测试时计算策略的兴起代表了 AI 研究范式的重要转变。2024 年,UC Berkeley 的研究者发表了一篇有影响力的论文,系统性地证明了在推理阶段投入更多计算可以等效于使用更大的预训练模型。具体而言,一个较小的模型配合充足的测试时计算预算,可以在推理任务上匹配甚至超越一个大 14 倍但只做单次推理的模型。这一发现催生了所谓的「推理时 Scaling Law」——即模型性能不仅可以通过增加训练计算来提升,也可以通过增加推理计算来提升。但这也引发了实际部署中的成本问题:如果每个请求都需要数十次甚至数百次的模型调用,推理成本将成倍增长,这对商业化部署构成了挑战。
-
更高效的样本内归纳,从少量示例中提取抽象规则。
分数背后仍需审慎看待
说个细节,ARC-AGI 系列的评测存在不同的赛道设定:有的允许模型进行大量的测试时搜索与计算,有的则严格限制计算预算和成本。同一个「分数」在不同评测条件下的含金量可能天差地别。因此,在缺乏完整评测细节(如计算成本、是否使用外部工具、具体测试子集)的情况下,单看 60.4% 这一数字仍需谨慎解读。
Kimi系列的技术演进路线
Kimi 系列由月之暗面(Moonshot AI)推出,此前已凭借超长上下文处理能力在国内外市场获得关注。月之暗面成立于 2023 年,由清华大学计算机系教授杨植麟创立,是中国大模型赛道的头部初创企业之一。公司在 2024 年初凭借 Kimi Chat 的 200 万字超长上下文能力引起广泛关注,随后在多轮融资中估值迅速攀升。
杨植麟此前在清华大学和卡内基梅隆大学的研究工作主要集中在 Transformer 架构的改进上,特别是在长序列建模方面有深厚积累——其参与的 Transformer-XL 和 XLNet 工作被广泛引用,这些研究解决了原始 Transformer 在处理超长序列时的记忆瓶颈问题。具体而言,Transformer-XL(2019年)通过引入段级递归(segment-level recurrence)机制,允许当前段的隐藏状态重用上一段的缓存状态,从而在不增加计算复杂度的情况下将有效上下文长度扩展到数千token。XLNet则在此基础上引入了排列语言模型(Permutation Language Model)目标函数,结合了自回归和双向注意力的优势,在当时的多项NLP基准上取得了最优成绩。这些工作为后来Kimi系列的超长上下文能力奠定了理论基础,也解释了为何月之暗面最初以长上下文为核心技术差异点。
这一技术背景解释了为何 Kimi 系列最初以超长上下文为突破口。在商业竞争层面,月之暗面与百川智能、智谱 AI、MiniMax 等构成了中国大模型初创企业的第一梯队,但各家的技术路线侧重点不同。
其技术路线经历了明显的阶段转变:早期以长上下文处理为核心卖点,解决了「大海捞针」式的长文档理解问题;中期开始在多模态能力上发力;近期则明确将推理能力作为技术突破的主攻方向。Kimi-K2 已经展示了在代码生成和数学推理上的进步,而 K3 如果在 ARC-AGI-2 上取得突破,则意味着其在更底层的抽象推理能力上也取得了进展。
从 Kimi 早期版本对长文本的强调,到近期在推理能力上的持续投入,可以看出其技术路线正在从「记忆容量」向「推理深度」演进。
如果 Kimi-K3 在推理基准上实现突破,这也符合当前整个大模型行业的趋势——从预训练规模竞赛转向推理与后训练(Post-Training)能力的竞赛。2020-2023 年间,大模型行业的主旋律是 Scaling Law——通过增加参数量、训练数据量和计算量来提升模型能力。但到 2024 年,行业普遍遇到了预训练阶段的收益递减问题。
这一瓶颈的原因是多方面的:首先是数据墙(Data Wall)——互联网上的高质量文本数据总量是有限的,据估计全球公开可用的高质量文本数据约为数万亿 token,而顶尖模型的训练数据量已经接近这一上限,部分模型甚至开始重复使用训练数据(epoch > 1),这会导致收益递减甚至过拟合;其次是能源和硬件瓶颈——训练一个万亿参数模型需要数千块顶级 GPU 运行数月,碳排放和电力成本已经成为制约因素;最后是理论层面的认知——研究者逐渐意识到,仅靠下一个 token 预测(next-token prediction)这一目标函数,可能从根本上无法产生深度推理能力,因为推理需要的是对因果关系的理解而非表面统计相关性的捕捉。
于是行业焦点转向了「后训练」阶段的技术创新,包括:基于人类反馈的强化学习(RLHF)、基于过程奖励模型(PRM)的推理训练、合成数据生成与自我对弈(self-play)、以及推理阶段的计算扩展。
其中,过程奖励模型(PRM)是当前提升推理能力的核心技术之一。与传统的结果奖励模型(ORM)只对最终答案正确性给予奖励不同,PRM对推理过程中的每一步都给予反馈——正确的推理步骤得到正奖励,错误的步骤得到负奖励。这一区别至关重要:在多步推理中,仅靠最终结果的对错来训练,模型很难定位问题出在哪一步(信用分配问题);而PRM提供的细粒度监督信号使模型能够更精确地学习何为好的推理步骤。OpenAI在2023年发表的论文《Let's Verify Step by Step》系统证明了PRM相比ORM在数学推理上的显著优势。
合成数据生成和自我对弈(self-play)则是解决后训练阶段高质量数据稀缺的关键手段。人工标注的高质量推理过程成本极高且规模有限,而合成数据方法通过让模型自己生成训练数据来规避这一瓶颈:让模型尝试解题,保留正确的推理轨迹作为正样本,利用验证器过滤错误答案。自我对弈则借鉴AlphaGo的思路——让模型与自身对弈来不断提升,表现为模型生成问题→尝试解答→自我评估→迭代改进的循环。Meta的Self-Rewarding Language Models和DeepSeek-R1的训练过程都大量采用了这类技术。
这一转型的标志性事件是 OpenAI o1 的发布,它证明了通过后训练和测试时计算的结合,可以在不增加模型参数的情况下大幅提升推理能力。
OpenAI 的 o 系列、以及各家厂商在强化学习与推理链上的投入,都指向同一个方向:让模型「想得更久、想得更深」,而不仅仅是「记得更多」。
对大模型行业的两点关键启示
国产大模型在硬核推理赛道主动出击
无论具体数字最终如何,Kimi-K3 引发的讨论本身反映出一个信号:国产大模型正在硬核推理这一「最难啃的骨头」上主动出击。ARC-AGI 这类基准不看重语言流畅度和知识广度,而是直指智能的核心——抽象与泛化,这恰恰是最难通过工程堆砌来短期提升的领域。
警惕对单一基准分数的过度追捧
同时,我们也应警惕对单一基准分数的过度解读。ARC-AGI 之所以有价值,正在于它难以被「刷分」;但任何基准一旦成为竞争焦点,都可能面临针对性优化的风险。
AI 领域有大量基准测试被「攻克」后才发现模型并未真正具备相应能力的历史教训。例如,早期的阅读理解基准 SQuAD 在模型超越人类表现后,研究者发现模型实际上大量依赖表面词汇匹配而非真正理解;Winograd Schema Challenge 被设计来测试常识推理,但大模型通过海量预训练数据中的统计规律也能取得高分;ImageNet 曾是计算机视觉的金标准,但后来发现模型大量利用纹理而非形状进行分类,导致在真实场景中泛化不佳;GSM8K 数学基准在发布一年内就被多个模型「攻克」,但研究者通过简单改变题目中的数字就能让模型准确率大幅下降,说明模型可能记住了解题模板而非真正理解数学推理。
这种现象被称为 Goodhart's Law 在 AI 评估中的体现——当一个指标变成目标时,它就不再是一个好指标。ARC-AGI 系列通过确保每道题都是全新设计来对抗这一问题,但如果模型针对 ARC 的题目结构进行专门训练(如生成大量 ARC 风格的合成数据),仍然存在「分布内过拟合」的可能性——模型可能学会了「ARC 类型题目的解题元策略」而非真正的抽象推理能力,这是一种更微妙的过拟合形式。
真正的验证,还需要看模型在真实、开放、多样任务中的综合表现,以及独立第三方的复现结果。
结语:衡量AI进步的标尺正在改变
Kimi-K3 在 ARC-AGI-2 上 60.4% 的传闻,为推理模型赛道投下了一颗石子。若消息属实,它标志着大模型在抽象推理上的又一次重要进阶;即便仍待官方确认,这场讨论也再次提醒我们:衡量AI进步的标尺,正在从「知道多少」转向「能推理多深」。
我们期待更多官方评测细节和独立复现的出现,届时才能对这一成绩做出更确切的判断。在此之前,保持关注、保持审慎,或许是面对每一个「刷新纪录」消息时最理性的态度。
核心要点
相关推荐

AI生成视频封面实战:分层提示词告别模板套图
B站UP主七爷分享AI生成视频封面的完整方法论,揭示如何通过分层拆解提示词避免AI模板味,涵盖标题层级划分、主视觉取舍、缩略图适配等实用技巧,附公开提示词模板可直接复用。

梯度下降训练的普适性:神经网络架构选择真的重要吗
探讨梯度下降训练的普适逼近能力,分析神经网络架构选择与可学习性的关系。从普适逼近定理到神经正切核理论,解读为什么梯度下降能在不同架构下稳定收敛,以及这对深度学习架构设计的启示。

DIY空气净化器:用PC风扇和铝框打造静音CR盒子
详解如何用电脑机箱风扇和铝制框架DIY一台低噪音Corsi-Rosenthal空气净化器,涵盖PC风扇选型、PWM调速方案、性能对比及成本分析,适合追求静音和美观的硬件爱好者。