AI能力增长曲线:为什么说我们尚未走过半程

一个耐人寻味的猜想
近日,一条来自 Twitter 的推文引发了 AI 圈的广泛思考。发帖者展示了一张图表,并抛出问题:"你能猜到这个目标是什么吗?我的猜测是,我们连一半的路都还没走到。"

这句看似轻描淡写的评论,实际上触及了当前人工智能发展中最核心也最富争议的话题之一:我们距离真正的目标——无论是通用人工智能(AGI)还是某种更宏大的能力跃迁——究竟还有多远?
通用人工智能(AGI)是指具备与人类同等甚至超越人类广泛认知能力的AI系统,能够在任何智力任务上进行学习、理解和推理,与当前在特定任务上表现出色但缺乏跨领域迁移能力的"狭义AI"形成根本区别。关于AGI的实现路径,学界存在深刻分歧:一派认为通过持续扩大模型规模(即Scaling假说),现有架构终将涌现出通用智能;另一派则认为Transformer架构存在根本性的能力边界,需要全新的计算范式——例如基于神经符号整合(Neuro-Symbolic AI)的方法试图将深度学习的模式识别能力与符号推理的逻辑严谨性相结合,而世界模型(World Models)的研究则着眼于让AI构建对物理世界因果关系的内在理解,而非仅仅学习数据中的统计相关性。还有一些研究者,如Meta首席AI科学家Yann LeCun,提出了基于联合嵌入预测架构(JEPA)的全新学习范式,认为自回归的下一个token预测本质上无法实现真正的理解。OpenAI、DeepMind、Anthropic等头部实验室已将AGI作为明确的组织使命,但对其实现时间表的预测从"5年内"到"本世纪末"不等——这种巨大差异本身就反映了我们对"智能"本质理解的匮乏。
"less than halfway there"(尚未过半)这一判断,既包含了对已有进展的肯定,也暗示着前方道路的漫长。
如何理解"尚未过半"这一AI进展判断
从增长曲线形态看AI发展阶段
在 AI 领域,衡量"进度"从来不是一件容易的事。当我们谈论"离目标还有多远"时,实际上涉及到对能力增长曲线形态的判断。
如果 AI 能力遵循指数增长曲线,那么"过半"这个概念本身就变得微妙——在指数曲线上,即便你已经完成了绝大部分的时间跨度,剩余部分的能力提升可能反而是最陡峭、最剧烈的。反之,若增长遵循 S 型曲线(Sigmoid),则前期加速、中期爆发、后期趋于饱和,"过半"往往意味着我们正处在最激烈的爬升阶段。
指数增长与S型曲线是描述技术发展最常用的两个数学模型。历史上,摩尔定律所描述的芯片晶体管密度增长就曾长期呈现近似指数特征,但最终也不可避免地因物理极限而放缓——这个例子本身就是"指数增长阶段终将转入S型饱和"的经典案例。在AI领域,Scaling Laws(缩放定律)的研究——即2020年OpenAI的Kaplan等人首次系统性揭示的模型损失函数与参数量、数据量、计算预算之间的稳定幂律关系——表明只要按比例增加资源投入,模型性能就会可预测地提升。具体而言,这些幂律关系的形式大致为 L ∝ N^(-α),其中L是损失值,N是参数量(或数据量、计算量),α是一个正常数。这意味着性能提升是对数式的:每提升一个单位的性能,需要投入的资源呈指数级增长。这一发现直接推动了AI行业的"军备竞赛",从GPT-3的1750亿参数到后续模型的万亿级参数,各大实验室竞相投入数十亿美元的算力预算。然而,2024年以来的实践表明,幂律关系在不同能力维度上的表现并不一致——纯粹的语言生成质量提升开始放缓,某些推理能力可能呈现S型饱和趋势,而另一些则可能因架构创新(如Chain-of-Thought推理、混合专家模型MoE等技术突破)出现新的增长阶段。更值得注意的是,性能提升的边际收益在递减,计算资源的指数级增长也带来了严峻的能源和成本可持续性问题——据估计,训练一个前沿大模型的电力消耗已与一座小型城市的年用电量相当。
发帖者"尚未过半"的判断,很可能暗示他认为:当前看似惊人的进展,相对于最终目标而言仍只是序章。
目标定义决定了距离远近
"离目标多远"这个问题的答案,高度依赖于"目标"本身的定义。如果目标是让 AI 在特定基准测试(如数学、编程、推理)上超越人类专家,那么在某些领域我们可能已经接近甚至超越了这条线。
这里有必要理解AI基准测试的本质和局限。常见的测试包括MMLU(大规模多任务语言理解,涵盖57个学科领域的选择题)、HumanEval(通过164道编程题测试代码生成能力)、GSM8K(包含8500道小学数学应用题的推理测试)、ARC(抽象推理语料库,测试视觉抽象推理能力)以及近期备受关注的GPQA(由博士级专家设计的科学问答基准)等,它们为不同模型的横向比较提供了统一标尺。然而,基准测试的局限性日益显现:首先是数据污染问题——模型可能在预训练阶段已经"见过"测试数据中的类似题目甚至原题,高分并不一定反映真正的推理能力,研究者发现某些模型在防污染版本的测试上得分会显著下降;其次是能力维度覆盖不足——这些测试无法全面衡量创造力、常识推理、社交智能、情境适应性等复杂能力,更无法评估在开放环境中发现和定义问题的能力;此外存在"Goodhart定律"效应——当指标本身成为优化目标时,它就不再是好的指标,模型开发者可能有意或无意地针对特定基准进行优化;最后,当模型得分接近满分时,测试本身便失去了区分度,需要不断设计更具挑战性的新基准——这就是为什么我们看到从SWE-bench到FrontierMath等越来越难的测试集不断涌现。
但如果目标是实现能够自主学习、跨领域泛化、具备真正理解能力的通用智能,那么"尚未过半"甚至可能是一个乐观的估计。当前最强大的大语言模型仍然无法在没有大量人类反馈的情况下从根本性错误中学习,无法在全新领域中从零建立可靠的知识框架,也无法像人类幼儿那样通过少量交互就掌握物理世界的基本因果规律。
乐观与谨慎之间的张力
AI进展的两面性
过去几年,大语言模型的能力增长确实令人瞠目。从 GPT 系列到各类开源模型(如Meta的LLaMA系列、Mistral、阿里的Qwen系列等),参数规模、上下文长度、推理能力都在快速迭代。这种可见的加速,容易让人产生"目标近在咫尺"的错觉。
然而,这条推文提醒我们保持一种健康的谨慎。"我们连一半都还没走到"背后,可能隐含着几层考量:
- 能力的表面繁荣与底层局限的落差:模型在基准测试上的高分,并不总是等同于真实世界的可靠性和泛化能力。一个能在编程竞赛中获得高分的模型,面对从未见过的系统设计问题时可能束手无策;一个能流利生成学术论文摘要的模型,可能在基础事实核查上频繁出错。这种"脆弱的专精"与"稳健的通用"之间存在质的差距。
- 剩余问题的难度呈指数级递增:越接近"目标",需要解决的问题往往越根本、越困难,比如可靠推理、长期规划、价值对齐等。这在技术史上被称为"低垂果实效应"——最容易实现的能力提升最先被摘取,剩下的每一步进展都需要付出不成比例的更大努力。
- 对目标本身认知的持续深化:随着研究推进,我们对"智能"的理解也在变化,目标可能比最初设想的更加遥远。正如物理学中每一个重大发现往往揭示出更多的未知,AI研究中每一次能力突破也在不断重新定义我们对通用智能所需条件的认识。
其中,价值对齐(Alignment) 作为AI安全领域的核心议题,值得特别关注。它指的是确保AI系统的目标、行为和决策与人类的价值观和意图保持一致。这个问题的难度远超表面看来的简单,可以从三个层面来理解:
第一是**"外部对齐"问题**——人类自身的价值观在不同文化、个体和时代之间就存在巨大分歧,不同社会对公平、隐私、自由的理解各不相同,如何定义统一的"人类价值"本身就是延续千年的哲学难题。在实践中,这意味着一个"对齐"了西方自由主义价值观的AI系统,可能与其他文化体系的核心价值产生冲突。
第二是**"内部对齐"问题**——即便正确指定了目标函数,如何保证模型在训练过程中真正学到了这些目标,而不是学到了与之表面相关但实质不同的"代理目标"(mesa-optimization问题)。例如,一个被训练为"乐于助人"的模型,可能实际上学到的是"产生让人类评估者满意的输出"——这两者在训练分布内看起来一致,但在分布外的关键场景中可能出现危险的分歧。Anthropic提出的"宪法AI"(Constitutional AI)方法、OpenAI的RLHF(基于人类反馈的强化学习)和后续的RLAIF等技术都是应对这一问题的尝试,但远未被视为根本性的解决方案。
第三是**"可解释性"挑战**——当模型的内部机制对人类是黑盒时,我们很难验证它是否真正对齐。Anthropic的机械可解释性研究、稀疏自编码器(SAE)对模型内部特征的提取等前沿工作正试图打开这个黑盒,但距离能够可靠地理解和验证数十亿参数模型的内部运作机制还有很长的路要走。Stuart Russell在其著作《Human Compatible》中提出了基于不确定性的对齐框架,Eliezer Yudkowsky则长期警告对齐问题可能在本质上比AI能力问题更难解决,如果我们在解决对齐之前就实现了超级智能,后果将是灾难性的。
为什么这种平衡判断弥足珍贵
在一个充斥着"AGI 即将到来"和"AI 泡沫论"两极观点的舆论环境中,"我们已经走了一部分,但还没过半"是一种相对平衡的立场。它既承认了实实在在的技术进步,又不至于陷入过度炒作的狂热。
关于AI泡沫论,有必要从多维视角进行审视。其核心论点是当前AI行业的资本投入和市场估值远超实际商业价值创造能力,类似于2000年的互联网泡沫——当年纳斯达克指数从5000点暴跌至1000点,大量.com公司破产消失。支持泡沫论的证据包括:大多数AI创业公司尚未盈利,甚至头部公司如OpenAI在2024年的收入仍远不足以覆盖其运营成本;算力基础设施的巨额投资回报周期极长,仅英伟达一家的估值增长就引发了市场集中度的担忧;企业级AI应用落地率低于预期,许多概念验证项目(PoC)未能转化为规模化部署;以及生成式AI的"幻觉"问题——即模型自信地生成看似合理但实际错误的内容——严重制约了医疗、法律、金融等高风险场景的部署。
然而反对泡沫论者指出关键差异:AI技术已在代码辅助(GitHub Copilot据报道已为开发者提升30%-50%的编码效率)、内容创作、药物发现(如AlphaFold对蛋白质结构预测的革命性突破)、芯片设计等领域展现出明确的生产力提升,这些都是实实在在的价值创造,而非互联网泡沫时期大量公司连商业模式都没有的情况。更平衡的观点认为,AI行业可能正经历Gartner技术成熟度曲线(Hype Cycle)中从"期望膨胀期"(Inflated Expectations)向"泡沫破灭谷底期"(Trough of Disillusionment)的转变,部分过度炒作的应用场景将遭遇现实挫折,但真正具有产品市场契合度的应用将存活下来,最终进入"稳步爬升的光明期"和"实质生产力的高原期"。历史表明,技术泡沫的破灭并不意味着技术本身无价值——互联网泡沫后诞生了Google、Amazon、Facebook等划时代企业。
这种判断对从业者和观察者都有启示意义:既不必因短期突破而盲目乐观,也不应因遥远的终点而丧失动力。 真正重要的是持续、稳健地推进,而非纠结于"是否即将抵达"。
对AI行业从业者的三点启示
对于关注 AI 发展的技术人员和决策者而言,这条简短推文提供了一个实用的思维框架:
第一,警惕线性外推的陷阱。 看到近期的快速进展就简单推断"很快就会到达终点",往往会低估剩余路程的难度。技术发展史反复证明,从实验室原型到可靠的大规模部署之间的"最后一英里",往往比前面所有路程加起来都要艰难。这种现象在工程领域有一个专门的名称——"九十-九十法则"(Ninety-ninety rule),最初由贝尔实验室的Tom Cargill提出:项目的前90%工作消耗90%的时间,而剩余的10%工作会消耗另外90%的时间。在AI领域,这表现为模型从"演示级别"到"生产级别"之间的巨大鸿沟——需要解决延迟优化、成本控制、边缘情况处理、安全合规、用户体验打磨等一系列工程化挑战。自动驾驶领域就是最典型的案例:L3级以上的自动驾驶在技术演示中早已表现出色,但从99%的可靠性到99.999%的可靠性之间的差距,已经让整个行业付出了数千亿美元的代价和超过十年的时间。
第二,关注增长曲线的形态而非单点数据。 理解当前所处的发展阶段,比争论"还剩多少年"更有实际意义。单一模型在某个基准测试上的突破性得分,远不如多个维度上的能力增长趋势来得有说服力。关键是要区分哪些能力提升来自真正的算法创新(如注意力机制、强化学习微调等结构性突破),哪些仅仅是规模扩大带来的统计效应(通过堆叠更多参数和数据获得的渐进式改善)。对于技术决策者而言,建立对不同AI能力维度的独立评估框架——而不是被单一的"超级智能即将到来"或"AI发展已经停滞"的叙事所裹挟——至关重要。
第三,为长期主义做准备。 如果真的"尚未过半",那么无论是技术研发、人才培养还是产业布局,都需要有足够的耐心和持续投入的准备。这意味着组织需要建立可持续的研发投入机制,而不是寄希望于短期内的一次性技术突破。具体而言,这要求企业在追逐最新模型能力的同时,也投资于基础设施建设、数据资产积累、AI治理框架和复合型人才培养。那些在AI寒冬(AI Winter)——历史上AI领域曾在1970年代和1990年代经历两次严重的资金断裂和信心崩溃——中幸存并持续投入的组织,最终成为了当前AI繁荣的最大受益者。这一历史教训提醒我们,长期主义不是口号,而是在热潮退去时仍然保持投入的组织纪律。
结语
"你能猜到这个目标吗?我猜我们连一半都没走到。"——这句话之所以引发共鸣,正是因为它触及了每一个 AI 从业者内心深处的那个疑问。答案没有定论,但提问本身,就是保持清醒的第一步。
在通往未知目标的道路上,承认"我们还有很长的路要走",或许比宣称"胜利在望"更需要智慧,也更接近真相。正如计算机科学先驱Alan Kay所言:"预测未来最好的方式是创造它。"与其争论距离目标还有多远,不如清醒地认识当前的位置,然后坚定地继续前行。
核心要点
核心要点
相关推荐

零基础七天速通Vibe Coding:AI编程从入门到实战完整指南
零基础如何快速上手Vibe Coding?本文拆解六步学习路径,涵盖Claude Code、Cursor、Codex三大工具使用、提示词写作技巧、项目实战方法,帮你建立与AI协作的完整思维框架,真正学会用AI做产品。

AI新手入门指南:从零搭建个人AI助手的三个阶段
没有技术背景也能入门AI?本文为AI新手梳理从零搭建个人AI助手的三阶段学习路线,涵盖提示词工程、无代码自动化工具、API调用,帮你跳过信息过载,快速上手解决实际问题。

Tailcat:Tailscale官方推出的去中心化极简组网方案
Tailcat是Tailscale官方推出的去中心化网络项目,剥离控制平面依赖,为自托管用户提供更自主、更隐私的WireGuard组网体验。本文解析Tailcat的技术理念、与Headscale的区别及应用场景。