Verified75% confidenceOpinionTime unknown
SWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标
5
Sources
75%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Claude Opus 4.7发布:编程性能提升20%,同价不涨,国产模型差距再拉大
bilibili库洛米大人的大人
Related Entities
Related Claims
UnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准79% similarUnverified在 SWE-bench 真实 GitHub Issue 修复任务中,不同厂商模型的修复成功率差异可达15-30个百分点77% similarUnverifiedSWE-bench从真实GitHub Issues中提取任务,要求模型修复主流开源项目的真实Bug,被视为衡量实际解决工程问题能力的黄金标准76% similarUnverifiedSWE-bench评估基准收集了来自真实GitHub仓库的数百个Issue和对应的修复方案76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/13831API
curl https://kongchang.com/api/v1/knowledge/claims/13831MCP
get_claim(id=13831)