待验证50% 置信基准精确时间
2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%
1
来源数
50%
置信度
长期有效
时效性
2026/7/18
首次发现
来源
相关事实
待验证在样本严重不均衡时,精度(Accuracy)会产生误导,模型把所有人都预测为健康精度照样能达到99%以上74% 相似待验证JCE所谓的'可靠'实际只有约60%的准确率,因误差累积连续5步后整体成功率仅剩约7.8%72% 相似待验证测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间71% 相似待验证测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)71% 相似待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/556540API
curl https://kongchang.com/api/v1/knowledge/claims/556540MCP
get_claim(id=556540)