待验证50% 置信基准精确时间
在使用同一checkpoint、同为max effort设置时,DeepSeek精简版harness在DeepStop UE上得分72.6,而OpenCode仅为65.5
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证DeepSeek的编程智能体DeepSWE在SWE-bench基准测试中从预览版的12.8分提升至62.7分76% 相似待验证DeepStop UE(DeepSeek Open Source Benchmark for Unified Evaluation)是DeepSeek用于评估编程智能体能力的基准测试集,考察智能体与harness协同运作的整体表现72% 相似待验证DeepSeek V4.1 Flash在Deep SWE软件工程代码测试上拿到74分,是UP主见过的第一个在Deep SWE上达到74分的开放权重模型71% 相似待验证DeepSeek-R1在SWE-Bench Verified基准测试中的解决率为49.2%70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/932802API
curl https://kongchang.com/api/v1/knowledge/claims/932802MCP
get_claim(id=932802)