待验证50% 置信事实精确时间
研究显示人类在标注90%置信度时,实际正确率往往只有70%左右,存在系统性过度自信
1
来源数
50%
置信度
长期有效
时效性
2026/7/7
首次发现
来源
AI超级预测者:机器能否超越人类专家的预测能力?
hackernewshackernews2026/7/6
相关事实
待验证95%置信水平意味着如果用相同方法重复进行100次调查,大约有95次的结果会落在误差范围之内72% 相似待验证研究表明LLM裁判与人类评分的一致率约为80%,接近但尚未超越人类自身一致性水平(约81%)72% 相似待验证在样本严重不均衡时,精度(Accuracy)会产生误导,模型把所有人都预测为健康精度照样能达到99%以上70% 相似待验证测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间69% 相似待验证在财务报表中,字符准确率可能高达99%,但语义准确率可能不足50%68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/180107API
curl https://kongchang.com/api/v1/knowledge/claims/180107MCP
get_claim(id=180107)