[控场AI]
基准

Frontier Code

由Cognition(Devin AI开发商)维护的第三方编程基准测试,专门衡量长程编程智能体能力,被认为比HumanEval更贴近真实生产场景

时间轴 (近 90 天)

9月4日

在 Cognition 的 Frontier Code 评测中,Fable 5 即便只开启中等推理强度,得分仍位列所有前沿模型第一

待验证50%

全部知识事实 (1)

来源文章