待验证50% 置信事实精确时间
许多模型在错误答案上仍表现出高度自信,存在自信度校准(confidence calibration)问题
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证学术界将模型置信度与实际准确率存在显著偏差的现象称为校准不良(Poor Calibration)76% 相似待验证深度学习模型普遍存在过度自信问题,模型输出的概率值并不真实反映其预测正确的实际概率,这一现象被称为校准不良(Poor Calibration)75% 相似待验证精确性偏见指人们对包含精确数字的陈述倾向于赋予更高可信度,实验显示受试者对「41.3%」的可信度评分显著高于「大约40%」73% 相似已验证在样本严重不均衡时,精度(Accuracy)会产生误导,模型把所有人都预测为健康精度照样能达到99%以上71% 相似待验证2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/902565API
curl https://kongchang.com/api/v1/knowledge/claims/902565MCP
get_claim(id=902565)