待验证50% 置信基准精确时间
在 SWE-bench 真实 GitHub Issue 修复任务中,不同厂商模型的修复成功率差异可达15-30个百分点
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/8
首次发现
有效期至:2026/10/6
来源
OpenAI官方插件codex-plugin-cc:在Claude Code中调用Codex实现双AI协作
githubGitHub Trending2026/7/3
相关事实
待验证2023年普林斯顿大学的SWE-bench基准测试显示,当时最先进的AI编程工具在真实GitHub Issue修复任务中的成功率仅约13%78% 相似已验证SWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标77% 相似待验证SWE-bench要求模型在真实GitHub代码仓库中定位并修复bug,通过率从最初的不到2%逐步提升到20%以上77% 相似待验证SWE-bench要求模型解决GitHub上的真实issue,其通过率即便对最强模型也不超过50%73% 相似待验证在SWE-bench软件工程基准上的自动代码修复率已从最初的不足5%提升至30%以上71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/308983API
curl https://kongchang.com/api/v1/knowledge/claims/308983MCP
get_claim(id=308983)