待验证50% 置信事实精确时间
SWE-bench要求模型阅读真实GitHub仓库的Issue,自主生成补丁并通过隐藏测试集验证,被认为是最贴近工程实战的代码能力基准之一
1
来源数
50%
置信度
长期有效
时效性
2026/9/23
首次发现
来源
涉及实体
相关事实
待验证SWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景80% 相似已验证SWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug78% 相似已验证SWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准77% 相似待验证SWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标77% 相似待验证SWE-bench评估模型解决真实GitHub issue的能力,LiveCodeBench使用竞赛编程题目防止数据泄露76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/943487API
curl https://kongchang.com/api/v1/knowledge/claims/943487MCP
get_claim(id=943487)