待验证50% 置信事实精确时间
通用大模型在置信度校准方面普遍存在过度自信问题,倾向给出接近100%的置信度
1
来源数
50%
置信度
长期有效
时效性
2026/9/24
首次发现
来源
涉及实体
相关事实
待验证许多模型在错误答案上仍表现出高度自信,存在自信度校准(confidence calibration)问题79% 相似待验证研究显示人类在标注90%置信度时,实际正确率往往只有70%左右,存在系统性过度自信75% 相似待验证精确性偏见指人们对包含精确数字的陈述倾向于赋予更高可信度,实验显示受试者对「41.3%」的可信度评分显著高于「大约40%」73% 相似已验证在样本严重不均衡时,精度(Accuracy)会产生误导,模型把所有人都预测为健康精度照样能达到99%以上71% 相似待验证LLM输出的概率分数(logprobs)与校准过的置信度存在本质差异,大型语言模型普遍存在过度自信问题,在分布外样本上尤为明显67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/946977API
curl https://kongchang.com/api/v1/knowledge/claims/946977MCP
get_claim(id=946977)