待验证50% 置信基准精确时间
Claude 模型在 Terminal Bench 4.0 终端编码测试上的得分从42%提升到接近56%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/4
首次发现
有效期至:2026/12/3
来源
涉及实体
相关事实
待验证Fable 5.1 在 Terminal Bench Science 0.1 基准测试中得分 52.6%,相比上一代翻了一倍多67% 相似待验证Terminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平66% 相似待验证Claude 5.1在Terminal-Bench Science上得分52.6%,相比上一代的24.7%实现翻倍以上跃升63% 相似待验证Claude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率61% 相似待验证DeepSeek V4 Pro's Terminal Bench score is slightly above open-source models Kimi K2.6, GLM 5.1, and Minimax M2.761% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/853043API
curl https://kongchang.com/api/v1/knowledge/claims/853043MCP
get_claim(id=853043)