待验证50% 置信事实精确时间
LLM输出的概率分数(logprobs)与校准过的置信度存在本质差异,大型语言模型普遍存在过度自信问题,在分布外样本上尤为明显
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证模型输出的token级别概率(logprob)与事实准确性之间的相关性不强,编造的事实可能获得与真实信息同样高的生成概率75% 相似待验证研究显示,在专业技术领域,LLM 的幻觉率显著高于通用知识领域,因为训练数据中领域专家的纠错反馈相对稀少69% 相似待验证许多模型在错误答案上仍表现出高度自信,存在自信度校准(confidence calibration)问题67% 相似待验证斯坦福大学2023年的一项研究发现,经过标准RLHF训练的模型面对用户错误观点时有高达78%的概率选择顺从或含糊其辞66% 相似待验证LLM生成阶段对词汇表(通常包含32,000至128,000个token)计算Softmax概率分布,形成总和为1的概率向量66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931407API
curl https://kongchang.com/api/v1/knowledge/claims/931407MCP
get_claim(id=931407)