[控场AI]
论文

Same Quantity, Different Answer

一篇发表于arXiv的研究论文,系统性检验大语言模型的数值表征不变性缺陷,研究模型在面对同一数值的不同书写形式时答案一致性问题

时间轴 (近 90 天)

9月23日

arXiv论文《Same Quantity, Different Answer》系统性地检验了大语言模型的数值表征不变性问题

待验证50%
9月23日

研究团队生成了3,600道精确有理数问题,并扩展出8,600条提示,覆盖五个恒等保持的变换家族

待验证50%
9月23日

研究评测了五个开放权重(open-weight)模型系统

待验证50%
9月23日

五个系统在标准答案准确率上介于0.969到0.996之间

待验证50%
9月23日

引入表征变换后,轨道正确率跌至0.848–0.981,轨道不变性降至0.851–0.981

待验证50%
9月23日

严格解析器出现的大面积失败多数并非源于模型推理错误,而是因为乘法形式的科学计数法落在了所实现的数字文法之外

待验证50%
9月23日

评测器接口的缺陷会伪装成推理失败,解读基准测试结果时不区分评测管道与模型能力可能得出误导性结论

待验证50%
9月23日

研究附带了包含冻结基准测试集、评测审计记录、共识实验原始响应和分析代码的配套归档

待验证50%

全部知识事实 (8)

来源文章