同量不同答:语言模型的数值表征不变性缺陷

同一数值换种写法,大模型答案就会漂移——评测器缺陷与单位量级偏差是主因
arXiv 论文《Same Quantity, Different Answer》用 3,600 道精确有理数题系统检验了大语言模型的数值表征不变性:同一个数以小数、分数、百分比、科学计数法、单位换算等形式呈现时,模型是否给出一致的正确答案。结果显示,标准答案准确率虽高达 0.969–0.996,但轨道不变性降至 0.851–0.981。进一步拆解发现,大多数「失败」并非真正的推理错误,而是评测解析器无法识别乘法形式科学计数法所致。真正值得警惕的是 Mistral Small 4 在单位换算上出现的 265 个系统性量级错误,答案与正确值恰好相差十的整数次幂。此外,用多种数值表征进行集成投票的「表征共识」策略,在低错误子集上不仅未优于传统的释义共识,还产生了更多误报。论文同时提供了完整的可复现工具链,示范了评测规范的最佳实践。
一个被忽视的问题:同一个数,换种写法答案就变了
对人类来说,0.5、1/2、50%、二分之一指的是同一个数值,解题时理应得到相同的答案。但大语言模型是否也能做到这一点?一篇最新的 arXiv 论文《Same Quantity, Different Answer》系统性地检验了这个看似简单却极具诊断价值的问题——数值表征不变性(Numerical Representation Invariance)。
研究的核心假设很直接:数值等价的应用题,无论量的写法是小数、分数、百分比、数字英文单词、科学计数法,还是经过精确换算的单位,都应当产生相同的标准答案。如果模型在这些等价变换下答案发生了漂移,那就暴露出它并非在真正理解数量,而是对特定表面形式产生了依赖。

实验设计:3600 道题与五类保恒变换
研究团队生成了 3,600 道精确有理数问题,并扩展出 8,600 条提示,覆盖五个「恒等保持」的变换家族——也就是说这些变换只改变数值的书写形式,不改变其真实数值。评测对象是五个开放权重(open-weight)系统。
为了避免评测环节本身引入噪声,团队采用了一个固定的语法审计流程,在不依赖 LLM 裁判的前提下对常见答案形式进行归一化。这一设计颇具巧思,因为它把「模型推理能力」和「评测器解析能力」这两件常被混为一谈的事情分开了。
「开放权重」(open-weight)模型指权重参数对外公开、可本地部署的模型,与完全闭源的商业 API 模型相对。在评测研究中选用开放权重模型的好处在于:研究者可以固定模型快照,确保实验可被他人精确复现,而无需担心服务端静默更新导致结果漂移。五类「恒等保持变换」具体包括:十进制小数(0.5)、分数(1/2)、百分比(50%)、英文数字词(one half)、科学计数法(5×10⁻¹),以及等值单位换算(如将千米换算成米)。这些变换的共同特点是改变数值的视觉呈现形式,而不触动其数学本质,因此任何真正理解数量的系统都应对其保持答案稳定。
关键发现:高准确率背后的不变性塌陷
在标准答案准确率(canonical accuracy)上,五个系统的表现相当亮眼,介于 0.969 到 0.996 之间。但当引入表征变换后,情况急转直下:
- 轨道正确率(orbit correctness) 跌至 0.848–0.981
- 轨道不变性(orbit invariance) 降至 0.851–0.981
- 「不变但错误」的轨道占比极低,最多只有 0.003
换句话说,模型在面对同一个数的不同写法时,答案会出现不一致。值得深究的是错误的来源。
大部分「崩溃」其实是评测器的锅
研究发现,严格解析器(strict-parser)出现的大面积失败,多数并非源于模型推理错误,而是因为乘法形式的科学计数法(如 3 × 10^4 这类写法)落在了所实现的数字文法之外。也就是说,模型给出的答案本身是对的,只是评测器无法识别这种格式,于是把它误判为错误。
这是论文最具警示意义的观点之一:评测器接口的缺陷会「伪装」成推理失败。在解读各类基准测试结果时,如果不区分评测管道与模型能力,很可能得出误导性的结论。
「轨道」(orbit)是本研究的核心概念单元,指同一道原始题目经过所有等价变换后产生的一组变体提示。例如,一道含有「0.5千克」的题目,其轨道包含改写为「1/2千克」「50%千克」等的所有版本。「轨道正确率」衡量一条轨道内所有变体是否都能得到正确答案;「轨道不变性」则更宽松,只要求轨道内各变体的答案彼此一致(即便整条轨道全部答错,也算「不变」)。两个指标的区别揭示了不同类型的失败:前者混合了推理错误和不一致错误,后者单独刻画了模型对表面形式的敏感程度。「不变但错误」占比极低(≤0.003)说明:当模型犯错时,往往伴随着不一致,即不同写法触发了不同的错误,而非稳定地犯同一种错。
一个真实的语义病理:Mistral Small 4 的单位换算错误
剔除评测器伪影后,仍然残留了一个真正的语义问题。Mistral Small 4 在单位换算输入上的得分仅为 0.699,并产生了 265 个错误——这些错误与正确标签恰好相差精确的十的幂次。
这种「差一个数量级」的系统性错误极具诊断意义。它不像随机噪声,而是指向模型在单位换算时对小数点位置或量级的处理存在稳定的认知偏差。这类错误在实际应用中尤其危险,因为答案在数值结构上「看起来合理」,却整整偏离了一个或多个数量级。
表征共识 vs 释义共识:多数投票并非万能
论文还设计了一个独立的 9,000 次调用实验,为对比的各组分配相同的调用次数,用以检验「表征共识」(representation consensus,即让模型对同一问题的多种表征形式投票)是否优于传统的「释义共识」(paraphrase consensus,即改写同一问题的表述)。
结论出人意料:在低错误率子集上,表征共识并未跑赢释义共识,反而产生了明显更多的误报(false alarms)。这提醒从业者,简单地通过增加数值表征多样性来做集成投票,并不能可靠地提升鲁棒性,有时甚至适得其反。
「释义共识」(paraphrase consensus)是自洽性采样(self-consistency)的一种常见变体:对同一道题用不同的自然语言表述方式重复提问,然后对多次回答进行多数投票以减少随机波动。这一方法由 Wang 等人(2022)在 chain-of-thought 推理研究中推广,在多个基准测试上有效提升了准确率。「表征共识」则是本研究提出的类比方案:不改变题目的语言表述,而是改变数值的书写形式。理论上,如果模型对不同数值表征的反应是独立的随机误差,多数投票应能抑制噪声;但实验结果表明,模型对某些特定表征形式存在系统性偏差而非随机噪声,这使得投票反而放大了误报,因为错误的写法会一致地将模型「带偏」到错误答案。
可复现性:完整的冻结基准与工具链
研究附带了一个配套归档,包含冻结的基准测试集、评测与审计记录、共识实验的原始响应、清单文件、分析代码,以及一条命令即可完成的论文构建脚本。这种彻底的可复现性配置,本身就是对社区评测规范的一次示范。
对从业者的启示
这项工作的价值不在于揭示了某个惊天缺陷,而在于它提供了一套区分「真问题」和「假问题」的方法论:
- 不要把评测器的解析局限当成模型的推理失败,尤其涉及科学计数法、单位、非常规格式时。
- 警惕系统性的量级错误,它们比随机错误更隐蔽也更危险。
- 集成投票需谨慎设计,增加输入多样性未必带来更好的一致性。
对于任何依赖语言模型处理数值和计算任务的场景,表征不变性都应当成为评测清单中的一项标准检查。
相关推荐

只想要一个自定义域名邮箱,为何如此艰难?
拥有一个自定义域名邮箱看似简单,实则涉及 SPF/DKIM/DMARC 配置、IP 信誉、托管服务成本等诸多难题。本文梳理自建与托管方案的权衡,并给出实用建议。

Claude意外帮用户发现燃气泄漏:AI助手的安全应用边界
一位Reddit用户借助AI助手Claude识别出家中燃气泄漏隐患,PG&E上门确认并修复。本文分析AI助手在家庭安全场景中的真实价值与使用边界,以及处理燃气泄漏的正确做法。

Gemini 4 Argon发布:谷歌重返前沿,但故事没那么简单
谷歌时隔半年发布前沿模型Gemini 4 Argon,跑分重返一线却暂不开放。本文解析其基准表现、与Sonnet 5.5的竞争,以及模型能力与产品体验之争。