基准
Frontier Code
由Cognition(Devin AI开发商)维护的第三方编程基准测试,专门衡量长程编程智能体能力,被认为比HumanEval更贴近真实生产场景
时间轴 (近 90 天)
9月4日
在 Cognition 的 Frontier Code 评测中,Fable 5 即便只开启中等推理强度,得分仍位列所有前沿模型第一
待验证50%
由Cognition(Devin AI开发商)维护的第三方编程基准测试,专门衡量长程编程智能体能力,被认为比HumanEval更贴近真实生产场景
在 Cognition 的 Frontier Code 评测中,Fable 5 即便只开启中等推理强度,得分仍位列所有前沿模型第一