Unverified50% confidenceBenchmarkExact time
SWE-bench 基准由普林斯顿大学研究团队于2023年发布,包含2294个经过验证的问题单-修复提交配对
1
Sources
50%
Confidence
Long-term
Relevance
7/11/2026
First Seen
Sources
云端Coding Agent深度拆解:国内用户如何理性选择
bilibili小行星AI观测站7/9/2026
Related Claims
UnverifiedSWE Bench由普林斯顿大学研究团队于2023年推出,测试集包含来自12个主流开源Python项目的2294个真实问题77% similarVerifiedSWE-bench是由普林斯顿大学研究团队于2023年推出的软件工程能力评测基准76% similarUnverifiedSWE-bench由普林斯顿大学Carlos E. Jimenez等研究者于2023年发布,包含来自12个真实Python开源仓库的2294个Issue-PR配对样本74% similarUnverifiedSWE-Bench由普林斯顿大学研究团队于2023年发布,要求模型在真实代码仓库语境下理解跨文件依赖、定位根因并生成补丁72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/485753API
curl https://kongchang.com/api/v1/knowledge/claims/485753MCP
get_claim(id=485753)