[控场AI]
基准SWE-bench Pro

SWE-Bench Pro

SWE-Bench Pro是一个用于评估AI模型软件工程能力的基准测试,是SWE-Bench系列的进阶版本。该测试通过提供真实的代码仓库问题与缺陷修复任务,考察AI系统在代码理解、问题定位与补丁生成等方面的实际工程能力,旨在更严格、全面地衡量AI模型解决真实世界软件开发任务的水平。

核心事实

时间轴 (近 90 天)

9月6日

Qwen3.8 Flash Next在SWE-Bench Pro得62.5分,Cowork Bench得73.9分,Android World得84.5分,Live Code Bench得91.9/95.7分

待验证50%
9月5日

Qwen3.8-Flash-Next在SWE-bench 1.1和SWE-bench Pro测评中分别取得58.7和62.5的成绩

待验证50%
8月23日

Muse Glimmer在DeepSearch QA得分74.6,SWE-Bench Pro得分51.2

待验证50%

全部知识事实 (5)

来源文章