待验证50% 置信基准精确时间
装了RTK之后,Claude的任务通过率掉了1个百分点,DeepSeek掉了2%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/29
首次发现
有效期至:2026/12/28
来源
涉及实体
相关事实
待验证同一个DeepSeek v1.1模型在Terminal Bench 2.0上不同Harness下的得分从69.8%跨到74.2%52% 相似待验证同一模型在DeepCWE上因智能体框架不同得分从65.5到74.2不等,官方harness用的是区间上限,Claude Code的harness下只有69.852% 相似已验证Devin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现52% 相似待验证根据Commander Code官方内部评测数据,DeepSeek V4 Pro在高难度工具依赖任务中10次有6次击败了Claude Opus51% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/957966API
curl https://kongchang.com/api/v1/knowledge/claims/957966MCP
get_claim(id=957966)