Unverified50% confidenceBenchmarkExact time
Claude 模型在 Terminal Bench 4.0 终端编码测试上的得分从42%提升到接近56%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/4/2026
First Seen
Valid until: 12/3/2026
Sources
Related Entities
Related Claims
UnverifiedFable 5.1 在 Terminal Bench Science 0.1 基准测试中得分 52.6%,相比上一代翻了一倍多67% similarUnverifiedTerminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平66% similarUnverifiedClaude 5.1在Terminal-Bench Science上得分52.6%,相比上一代的24.7%实现翻倍以上跃升63% similarUnverifiedClaude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率61% similarUnverifiedDeepSeek V4 Pro's Terminal Bench score is slightly above open-source models Kimi K2.6, GLM 5.1, and Minimax M2.761% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/853043API
curl https://kongchang.com/api/v1/knowledge/claims/853043MCP
get_claim(id=853043)