Frontier Math
由Epoch AI维护的面向前沿数学能力的评测基准,题目由职业数学家设计,涵盖竞赛数学、组合数学、数论等多个领域,按难度分为多个Tier,刻意回避互联网上已有的解题路径
时间轴 (近 90 天)
OpenAI公布Astra在Frontier Math Tier 4达到98%
此前顶尖模型在Frontier Math Tier 4层级的通过率普遍低于50%
Frontier Math是专为测试前沿数学推理能力设计的高难度题库,Tier 4代表最顶级难度区间
Frontier Math Tier 4从发布时最高得分不到5%到不到14个月后最高得分达98%,Epoch据此认为该基准已饱和
Epoch AI宣布Frontier Math Tier 4的所有题目已全部被AI攻破,GPT-6 Astra解出了最后一道未解难题
Frontier Math是由Epoch AI维护的评测基准,题目由职业数学家设计,刻意回避互联网上已有的解题路径以减少模型记忆作答的可能性
GPT-6 Astra爆料声称在FrontierMath Tier 4取得98%的得分
根据Artificial Analysis数据,GPT-6 Astra在智能指数上得分为61,与GPT-5.6 Sol持平,比Claude Fable 5.1低5分
Frontier Math 是由 EpochAI 创建的数学基准测试,此前 AI 模型在该测试上的通过率不足 2%
在 Frontier Math 上,50 道开放题已解决 4 道,GPT 和 Claude 各占 2 道
全部知识事实 (7)
此前顶尖模型在Frontier Math Tier 4层级的通过率普遍低于50%
50%待验证OpenAI公布Astra在Frontier Math Tier 4达到98%
50%待验证Frontier Math是专为测试前沿数学推理能力设计的高难度题库,Tier 4代表最顶级难度区间
50%待验证Frontier Math是由Epoch AI维护的评测基准,题目由职业数学家设计,刻意回避互联网上已有的解题路径以减少模型记忆作答的可能性
50%待验证Epoch AI宣布Frontier Math Tier 4的所有题目已全部被AI攻破,GPT-6 Astra解出了最后一道未解难题
50%待验证Frontier Math Tier 4从发布时最高得分不到5%到不到14个月后最高得分达98%,Epoch据此认为该基准已饱和
50%待验证Frontier Math 是由 EpochAI 创建的数学基准测试,此前 AI 模型在该测试上的通过率不足 2%
50%