待验证75% 置信事实时间未知
DeepSeek与Claude Sonnet在SWE-bench编码基准测试上的差距仅在1%以内
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
DeepSeek-TUI:免费Claude Code替代品,成本低20倍登顶GitHub
bilibili侧光译室
涉及实体
相关事实
待验证Claude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点67% 相似待验证DeepSeek-V3发布时在多项基准测试中与Claude 3.5 Sonnet持平甚至超越,训练成本据报道仅为主流闭源模型的数分之一67% 相似待验证Claude Code + DeepSeek稳定性测试得分100分,Codex + DeepSeek仅得40分67% 相似待验证GLM-4.7在代码能力基准测试中超过DeepSeek V3.2及Claude Sonnet 4.562% 相似待验证Sonnet 5在CursorBench编程基准上仅排在第13位61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/15204API
curl https://kongchang.com/api/v1/knowledge/claims/15204MCP
get_claim(id=15204)