Unverified50% confidenceBenchmarkExact time
2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%
1
Sources
50%
Confidence
Long-term
Relevance
7/18/2026
First Seen
Sources
Related Claims
Unverified在样本严重不均衡时,精度(Accuracy)会产生误导,模型把所有人都预测为健康精度照样能达到99%以上74% similarUnverifiedJCE所谓的'可靠'实际只有约60%的准确率,因误差累积连续5步后整体成功率仅剩约7.8%72% similarUnverified测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间71% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)71% similarUnverified2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/556540API
curl https://kongchang.com/api/v1/knowledge/claims/556540MCP
get_claim(id=556540)