待验证50% 置信事实精确时间
在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证研究表明模型在自我批评任务中的准确率显著低于由另一模型执行批评的场景76% 相似待验证模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距73% 相似待验证测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间72% 相似待验证在正负样本极度不均衡的场景(如欺诈检测)中,单纯看准确率作为评估指标毫无意义72% 相似待验证当前顶尖AI模型在CTF基准上的得分仍远低于人类专家水平,尤其是涉及动态调试和二进制分析的题目类别72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/510664API
curl https://kongchang.com/api/v1/knowledge/claims/510664MCP
get_claim(id=510664)