AI能力被低估?平均分掩盖的非凸真相

综合评分掩盖了AI在数学与编程领域的真实飞跃,大模型的能力分布是非凸的"修格斯",而非平滑的圆。
本文围绕一个反直觉的观察展开:科技社区流传的"AI进步停滞"判断,很可能源于对综合评测分数的误读。作者指出,大模型在数学和计算机科学领域的能力提升远超其他维度,但这种不均衡的进步被平均值所稀释,在综合曲线上显得波澜不惊。究其根本,数学与代码任务具备可自动验证的奖励信号,天然适配强化学习和推理模型的新训练范式,因此进步最为迅猛。模型真实的能力分布并非规整的圆形,而更像洛夫克拉夫特小说中那只在某些方向极度突出、在另一些方向深度凹陷的非凸"修格斯"。这种"参差不齐的智能"要求我们重构评测思路——分维度呈现能力边界,而非依赖单一折叠分数——同时也提示开发者和企业:选型时应聚焦于自身所需的特定维度,而不是笼统地问"模型强不强"。
一张图带来的错觉
最近在科技社区流传着一个耐人寻味的观点:如果你只看某些综合性的评测图表,你可能会得出一个结论——今天的大模型相比半年前并没有强多少。进步似乎陷入了停滞,边际收益不断递减。
但这个结论真的成立吗?发布该观点的开发者一针见血地指出:模型在数学和计算机科学领域的能力,相比其他任何领域都提升得快得多。换句话说,我们看到的"平缓",很可能是被平均值掩盖的假象。
这引出了一个关键的方法论问题:当我们用单一的综合分数去衡量一个高度不均衡的能力系统时,我们究竟测量到了什么?

平均值的陷阱:综合评测为何误导
大多数人评估AI进展时,习惯依赖某种"综合能力"指标——一个试图用单一数字概括模型全部实力的分数。这种做法直观、易于传播,但也极具误导性。
设想一个模型:它在数学推理上从60分飙升到90分,在代码生成上从55分跃升到88分,但在开放式写作、常识判断、多语言理解等维度上仅有微小提升。当你把这些维度取平均时,那两个突飞猛进的领域会被大量原地踏步的领域"稀释",最终呈现出的整体曲线看起来平淡无奇。
原文作者的比喻非常精妙:我们其实是在试图用一个圆来描述模型的"中位数能力"。圆是规整的、对称的、易于理解的。但真实的能力分布并非如此规整。
为什么数学和CS跑得最快
数学和计算机科学之所以进步神速,背后有其结构性原因:
- 可验证性强:数学题有标准答案,代码能否运行、能否通过测试用例是可以自动判定的。这为强化学习提供了清晰、廉价、可大规模生成的奖励信号。
- 数据可合成:与需要人工标注的主观任务不同,数学和代码可以通过程序自动生成海量训练样本,甚至让模型自己生成问题再自我验证。
- 推理链条明确:这两个领域的问题往往有清晰的逻辑步骤,非常适合链式推理(Chain-of-Thought)和测试时计算(test-time compute)等新范式发力。
正是这些特性,让近期的技术突破(尤其是推理模型)在这些领域产生了不成比例的巨大收益。
非凸的"修格斯":大模型能力分布的真实形态
原文中最具想象力的表述是:模型真实的"能力包络"(capability envelope)更像是一个高度非凸的修格斯(shoggoth)。
修格斯是洛夫克拉夫特笔下的一种形态不定、遍布触手与眼睛的怪物,在AI圈常被用来隐喻大模型那种既强大又难以捉摸、内部结构混乱的本质。这里作者用它来形容能力分布——不是一个平滑的圆,而是一个在某些方向上突出得极长、在另一些方向上却凹陷收缩的怪异形状。
"非凸"是关键词。凸的形状意味着任意两点之间的连线都落在形状内部,规律、可预测。而非凸意味着能力在不同维度上的分布是断裂、不连续甚至反直觉的:模型可能能解出奥林匹克级别的数学难题,却在简单的日常常识推理上犯低级错误。
这种"参差不齐的智能"(jagged intelligence)正是当代大模型的核心特征,也是为什么用户体验常常两极分化——有人惊叹于它的天才,有人吐槽它的愚蠢,其实他们只是触碰到了这个非凸形状的不同表面。
对行业的启示:如何正确评估AI实力
这个观点看似只是一个技术讨论,实则对整个行业都有深远意义。
评测体系需要重构
如果单一综合分数会系统性地掩盖真实进展,那么现有的许多榜单和基准测试就存在根本性缺陷。更合理的做法是:
- 分维度呈现能力,而非折叠成一个数字;
- 关注能力的边界和峰值,而不仅是中位数;
- 建立能捕捉"非凸"特征的动态评测,识别模型在哪些方向突进、哪些方向停滞。
应用落地的判断依据
对于开发者和企业而言,这意味着不能笼统地问"这个模型强不强",而要问"它在我需要的那个维度上强不强"。
一个在代码和数学上进步神速的模型,对编程工具、量化交易、科学计算等场景是革命性的;但对内容创作、情感陪伴、复杂社会判断等任务,提升可能微乎其微。理解能力包络的非凸性,才能做出正确的技术选型。
进步远未停滞
最重要的结论是:AI的进步远没有"平均曲线"显示的那么缓慢。它只是不均衡地集中在了特定领域。当我们感叹"AI好像没什么突破"时,很可能只是因为那些真正的突破,恰好不在我们日常使用的维度上。
结语
用圆去度量修格斯,注定会失真。这个来自开发者社区的观察提醒我们:面对日益复杂的AI系统,简单化的指标可能带来严重的认知偏差。
真正理解AI的进展,需要我们放弃对"单一分数"的迷恋,转而拥抱那个参差不齐、非凸怪异,却又在特定方向上狂飙突进的真实图景。数学与计算机科学,或许只是这只修格斯第一批伸长的触手——而它的其余部分,仍在暗处生长。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。