待验证50% 置信基准精确时间
在Terminal Bench跑分上,DeepSeek V4 Pro得87.9分,Claude Opus 4.8得85分
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/23
首次发现
有效期至:2026/11/21
来源
涉及实体
相关事实
待验证Qwen3.6 35B在SWE Bench Verified上的成绩距离Claude Opus 4.6仅差1.6个百分点74% 相似待验证据非官方爆料,Terminal Bench 3.0基准测试中Claude Opus 5 Max以43.5%的得分超越GPT-5.6-Sol的34.6%重登榜首72% 相似待验证Claude Opus 4.8在智能体实战跑分中拿下1890分,比上一代高出137分,甩开GPT 5.5达121分71% 相似待验证根据Commander Code官方内部评测数据,DeepSeek V4 Pro在高难度工具依赖任务中10次有6次击败了Claude Opus71% 相似待验证Claude Opus 4.6在SWE-Bench Pro测试中得分为53.4%71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/791785API
curl https://kongchang.com/api/v1/knowledge/claims/791785MCP
get_claim(id=791785)