[KongchangAI]
BenchmarkSWE-bench Pro

SWE-Bench Pro

SWE-Bench Pro是一个用于评估AI模型软件工程能力的基准测试,是SWE-Bench系列的进阶版本。该测试通过提供真实的代码仓库问题与缺陷修复任务,考察AI系统在代码理解、问题定位与补丁生成等方面的实际工程能力,旨在更严格、全面地衡量AI模型解决真实世界软件开发任务的水平。

Core Facts

Timeline (last 90 days)

Sep 6

Qwen3.8 Flash Next在SWE-Bench Pro得62.5分,Cowork Bench得73.9分,Android World得84.5分,Live Code Bench得91.9/95.7分

Unverified50%
Sep 5

Qwen3.8-Flash-Next在SWE-bench 1.1和SWE-bench Pro测评中分别取得58.7和62.5的成绩

Unverified50%
Aug 23

Muse Glimmer在DeepSearch QA得分74.6,SWE-Bench Pro得分51.2

Unverified50%

All Facts (5)

Source Articles