待验证50% 置信事实精确时间
当观测窗口与当地作物物候期不对齐时,模型精度崩盘但确定性置信度依然很高,即模型会自信地犯错
1
来源数
50%
置信度
长期有效
时效性
2026/10/8
首次发现
来源
涉及实体
相关事实
待验证TruthfulQA基准测试发现更大的模型有时会产生更自信的错误,这一现象被称为规模悖论74% 相似已验证若用含测试集的全量数据计算均值和标准差,会导致预处理泄漏,使评估指标虚高,无法真实反映模型泛化能力74% 相似待验证模型跳过检索直接作答的过度自信在技术上被称为校准不足(miscalibration),即置信度与实际正确率存在系统性偏差72% 相似待验证版本漂移在评测场景下危险,因为模型权重、推理框架或测试环境变更后历史测量结果有效性会隐性衰减72% 相似待验证研究揭示LLM并不像理想的贝叶斯智能体那样根据证据可靠性进行合理加权更新,而是表现出接近分布倾斜的行为模式,其影响与证据真实可靠性的关联比贝叶斯框架预期的弱72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/986742API
curl https://kongchang.com/api/v1/knowledge/claims/986742MCP
get_claim(id=986742)