[控场AI]
基准Frontier Math Benchmark

Frontier Math

由Epoch AI维护的面向前沿数学能力的评测基准,题目由职业数学家设计,涵盖竞赛数学、组合数学、数论等多个领域,按难度分为多个Tier,刻意回避互联网上已有的解题路径

时间轴 (近 90 天)

9月17日

OpenAI公布Astra在Frontier Math Tier 4达到98%

待验证50%
9月17日

此前顶尖模型在Frontier Math Tier 4层级的通过率普遍低于50%

待验证50%
9月17日

Frontier Math是专为测试前沿数学推理能力设计的高难度题库,Tier 4代表最顶级难度区间

待验证50%
9月16日

Frontier Math Tier 4从发布时最高得分不到5%到不到14个月后最高得分达98%,Epoch据此认为该基准已饱和

待验证50%
9月16日

Epoch AI宣布Frontier Math Tier 4的所有题目已全部被AI攻破,GPT-6 Astra解出了最后一道未解难题

待验证50%
9月16日

Frontier Math是由Epoch AI维护的评测基准,题目由职业数学家设计,刻意回避互联网上已有的解题路径以减少模型记忆作答的可能性

待验证50%
9月12日

GPT-6 Astra爆料声称在FrontierMath Tier 4取得98%的得分

已过期60%
9月5日

根据Artificial Analysis数据,GPT-6 Astra在智能指数上得分为61,与GPT-5.6 Sol持平,比Claude Fable 5.1低5分

已过期75%
8月24日

Frontier Math 是由 EpochAI 创建的数学基准测试,此前 AI 模型在该测试上的通过率不足 2%

待验证50%
8月24日

在 Frontier Math 上,50 道开放题已解决 4 道,GPT 和 Claude 各占 2 道

已过期50%

全部知识事实 (7)

来源文章