基准SWE-bench
SWE-Bench
SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。
时间轴 (近 90 天)
6月3日
Antigravity搭载的Gemini 3 Pro模型在SWE-Bench测试中得分76.2%
待验证80%
6月3日
2024年初SWE-Bench最好的系统得分仅在30%左右
待验证70%
6月2日
Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上
待验证60%
全部知识事实 (3)
来源文章
OpenAI发布GPT-5.6与ChatGPT Work:AI自主工作时代来临7月24日通义千问3.8即将开源,K3登顶引发中美AI差距新讨论7月23日多智能体与代码生成实测:新一代大模型能力深度解析7月23日国产三大模型齐发:Qwen4、DeepSeek V4、GLM新版本全面解析7月23日Claude Sonnet 5深度实测:8个真实任务揭示真实能力边界7月22日Claude用量焦虑:AI编程工具订阅制的隐形成本陷阱7月22日Kimi K3深度解析:2.8万亿参数开源大模型架构与实测全面解读7月22日Claude Sonnet 5深度实测:基准亮眼却令人失望,不如坚守OPUS 4.87月22日