已验证90% 置信事实精确时间
SWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug
12
来源数
90%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
AI编程为何进步最快?四大结构性优势深度解析
bilibili卢菁博士_北大AI博士后2026/6/5
相关事实
已验证SWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue84% 相似待验证SWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景82% 相似已验证SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁81% 相似待验证SWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准81% 相似待验证SWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标81% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/53529API
curl https://kongchang.com/api/v1/knowledge/claims/53529MCP
get_claim(id=53529)