Verified90% confidenceFactExact time
SWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug
12
Sources
90%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
AI编程为何进步最快?四大结构性优势深度解析
bilibili卢菁博士_北大AI博士后6/5/2026
Related Claims
VerifiedSWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue84% similarUnverifiedSWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景82% similarVerifiedSWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁81% similarUnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准81% similarUnverifiedSWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标81% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/53529API
curl https://kongchang.com/api/v1/knowledge/claims/53529MCP
get_claim(id=53529)