Unverified50% confidenceBenchmarkExact time
装了RTK之后,Claude的任务通过率掉了1个百分点,DeepSeek掉了2%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/29/2026
First Seen
Valid until: 12/28/2026
Sources
Related Entities
Related Claims
Unverified同一个DeepSeek v1.1模型在Terminal Bench 2.0上不同Harness下的得分从69.8%跨到74.2%52% similarUnverified同一模型在DeepCWE上因智能体框架不同得分从65.5到74.2不等,官方harness用的是区间上限,Claude Code的harness下只有69.852% similarVerifiedDevin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现52% similarUnverified根据Commander Code官方内部评测数据,DeepSeek V4 Pro在高难度工具依赖任务中10次有6次击败了Claude Opus51% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/957966API
curl https://kongchang.com/api/v1/knowledge/claims/957966MCP
get_claim(id=957966)