待验证50% 置信基准精确时间
在MATH数据集的Level 5竞赛级难题上,前沿模型准确率仍低于60%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/26
首次发现
有效期至:2026/11/24
来源
涉及实体
相关事实
待验证2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%76% 相似待验证JCE所谓的'可靠'实际只有约60%的准确率,因误差累积连续5步后整体成功率仅剩约7.8%75% 相似待验证当综合评估指数中顶尖模型得分接近天花板时会出现基准饱和问题,60分对59分的差距在统计学上通常处于误差范围之内73% 相似待验证当前顶级AI模型在SWE-bench上的解决率仍远低于竞赛成绩所暗示的水平71% 相似待验证研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/802593API
curl https://kongchang.com/api/v1/knowledge/claims/802593MCP
get_claim(id=802593)