待验证50% 置信事实精确时间
Frontier Math 是由 EpochAI 创建的数学基准测试,此前 AI 模型在该测试上的通过率不足 2%
1
来源数
50%
置信度
长期有效
时效性
2026/8/24
首次发现
来源
涉及实体
相关事实
待验证OpenAI的图表显示,在较低的测试时计算量下,模型对这道题的成功率接近零,只有在极长的推理链条下才偶尔成功63% 相似待验证Devin 2.0在SWE-bench基准测试中解决了13.86%的实际编程问题,而此前的AI模型仅为1.96%63% 相似待验证当前顶级AI模型在SWE-bench上的解决率仍远低于竞赛成绩所暗示的水平60% 相似待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力60% 相似待验证在Agency工具调用测试中两款模型均得95分,唯一失败的都是第13号任务(美元到日元外币转换)58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/792804API
curl https://kongchang.com/api/v1/knowledge/claims/792804MCP
get_claim(id=792804)