Unverified50% confidenceBenchmarkExact time
在Terminal Bench跑分上,DeepSeek V4 Pro得87.9分,Claude Opus 4.8得85分
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/23/2026
First Seen
Valid until: 11/21/2026
Sources
Related Entities
Related Claims
UnverifiedQwen3.6 35B在SWE Bench Verified上的成绩距离Claude Opus 4.6仅差1.6个百分点74% similarUnverified据非官方爆料,Terminal Bench 3.0基准测试中Claude Opus 5 Max以43.5%的得分超越GPT-5.6-Sol的34.6%重登榜首72% similarUnverifiedClaude Opus 4.8在智能体实战跑分中拿下1890分,比上一代高出137分,甩开GPT 5.5达121分71% similarUnverified根据Commander Code官方内部评测数据,DeepSeek V4 Pro在高难度工具依赖任务中10次有6次击败了Claude Opus71% similarUnverifiedClaude Opus 4.6在SWE-Bench Pro测试中得分为53.4%71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/791785API
curl https://kongchang.com/api/v1/knowledge/claims/791785MCP
get_claim(id=791785)