待验证50% 置信事实精确时间
arXiv论文《Same Quantity, Different Answer》系统性地检验了大语言模型的数值表征不变性问题
1
来源数
50%
置信度
长期有效
时效性
2026/9/23
首次发现
来源
涉及实体
相关事实
待验证一篇发表于arXiv的研究《Evidence Integration in Large Language Models》(arXiv:2609.04290v1)提出了一套分布式理论来解释LLM如何整合外部证据72% 相似待验证一篇arXiv论文(arXiv:2609.10830)利用OLMo-2和Pythia两个公开预训练语料的模型家族,以及可精确返回句子在语料中出现确切次数的公开索引来研究成员推断68% 相似待验证大型语言模型可通过分析token概率分布、显式输出自我评估分数或多次采样观察答案一致性等手段近似估计决策置信度68% 相似待验证传统大语言模型评测围绕单轮问答的准确性展开,给定问题输出答案后对照标准答案打分67% 相似待验证当前的大语言模型和生成模型本质上是在海量数据中寻找统计规律67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/942843API
curl https://kongchang.com/api/v1/knowledge/claims/942843MCP
get_claim(id=942843)