Benchmark
Frontier Code
由Cognition(Devin AI开发商)维护的第三方编程基准测试,专门衡量长程编程智能体能力,被认为比HumanEval更贴近真实生产场景
Timeline (last 90 days)
Sep 4
在 Cognition 的 Frontier Code 评测中,Fable 5 即便只开启中等推理强度,得分仍位列所有前沿模型第一
Unverified50%
由Cognition(Devin AI开发商)维护的第三方编程基准测试,专门衡量长程编程智能体能力,被认为比HumanEval更贴近真实生产场景
在 Cognition 的 Frontier Code 评测中,Fable 5 即便只开启中等推理强度,得分仍位列所有前沿模型第一