Same Quantity, Different Answer
一篇发表于arXiv的研究论文,系统性检验大语言模型的数值表征不变性缺陷,研究模型在面对同一数值的不同书写形式时答案一致性问题
时间轴 (近 90 天)
arXiv论文《Same Quantity, Different Answer》系统性地检验了大语言模型的数值表征不变性问题
研究团队生成了3,600道精确有理数问题,并扩展出8,600条提示,覆盖五个恒等保持的变换家族
研究评测了五个开放权重(open-weight)模型系统
五个系统在标准答案准确率上介于0.969到0.996之间
引入表征变换后,轨道正确率跌至0.848–0.981,轨道不变性降至0.851–0.981
严格解析器出现的大面积失败多数并非源于模型推理错误,而是因为乘法形式的科学计数法落在了所实现的数字文法之外
评测器接口的缺陷会伪装成推理失败,解读基准测试结果时不区分评测管道与模型能力可能得出误导性结论
研究附带了包含冻结基准测试集、评测审计记录、共识实验原始响应和分析代码的配套归档
全部知识事实 (8)
arXiv论文《Same Quantity, Different Answer》系统性地检验了大语言模型的数值表征不变性问题
50%待验证研究团队生成了3,600道精确有理数问题,并扩展出8,600条提示,覆盖五个恒等保持的变换家族
50%待验证研究评测了五个开放权重(open-weight)模型系统
50%待验证五个系统在标准答案准确率上介于0.969到0.996之间
50%待验证引入表征变换后,轨道正确率跌至0.848–0.981,轨道不变性降至0.851–0.981
50%待验证严格解析器出现的大面积失败多数并非源于模型推理错误,而是因为乘法形式的科学计数法落在了所实现的数字文法之外
50%待验证评测器接口的缺陷会伪装成推理失败,解读基准测试结果时不区分评测管道与模型能力可能得出误导性结论
50%待验证研究附带了包含冻结基准测试集、评测审计记录、共识实验原始响应和分析代码的配套归档
50%