已验证65% 置信事实时间未知
Devin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现
3
来源数
65%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
AI编程工具深度对比:Qoder、Cursor、Windsurf、Devin怎么选
bilibili烟岚九境
涉及实体
相关事实
待验证2023年普林斯顿大学的SWE-bench基准测试显示,当时最先进的AI编程工具在真实GitHub Issue修复任务中的成功率仅约13%73% 相似待验证Devin 2.0在SWE-bench基准测试中解决了13.86%的实际编程问题,而此前的AI模型仅为1.96%72% 相似待验证Devin在SWE-bench评测中达到13.86%的解决率(当时最高)71% 相似待验证在SWE-Bench编程基准测试中,Claude Code得分80.8%,GitHub Copilot仅为72.5%70% 相似待验证GitHub无障碍智能体测试中已审查3535个PR,问题解决率达到68%68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/3203API
curl https://kongchang.com/api/v1/knowledge/claims/3203MCP
get_claim(id=3203)