[控场AI]
基准

Frontier SWE

前沿软件工程基准测试,考察AI模型在高复杂度、开放式工程问题上的边界能力,侧重前沿和开放性工程挑战

时间轴 (近 90 天)

10月3日

在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底

待验证50%

全部知识事实 (1)

来源文章