待验证50% 置信观点精确时间
模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/12
首次发现
有效期至:2026/11/10
来源
相关事实
待验证在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平73% 相似待验证自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄71% 相似待验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点71% 相似待验证当多个模型在MMLU、HumanEval等测试中均达到90%以上的正确率时,用户关注点转向推理延迟、服务可用性和总体拥有成本等实操指标70% 相似待验证在实际工业环境中,模型准确率从95%提升到96%带来的业务价值往往远不如一套稳定可靠的自动化部署和监控体系70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/735726API
curl https://kongchang.com/api/v1/knowledge/claims/735726MCP
get_claim(id=735726)