基准
Frontier SWE
前沿软件工程基准测试,考察AI模型在高复杂度、开放式工程问题上的边界能力,侧重前沿和开放性工程挑战
时间轴 (近 90 天)
10月3日
在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底
待验证50%
前沿软件工程基准测试,考察AI模型在高复杂度、开放式工程问题上的边界能力,侧重前沿和开放性工程挑战
在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底