[控场AI]
基准Terminal Bench

Terminal Bench 4.0

专门评估AI模型在终端环境中执行编程任务能力的基准测试套件,重点考察命令行操作、脚本编写、代码调试及自动化工作流等真实开发场景表现

核心事实

时间轴 (近 90 天)

10月4日

Opus 5.5 在 Terminal Bench 4.0 测试中表现超过了 Astra 和 Fable 5.1

待验证50%
9月30日

在 Terminal Bench 4.0 最高难度设置下,Sonnet 5.5 的表现超过 Opus 5.5

待验证50%
9月30日

在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元

待验证60%
9月25日

在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%

已验证65%
9月11日

在Terminal Bench 4.0上,Astra成本约10.35美元,Fable 5.1约19.50美元

待验证50%
9月9日

在Terminal Bench 4.0最高精度测试中,Fable 5.1准确率为55.8%,成本为19.50美元;Astra准确率为56.7%,成本为10.35美元

待验证60%
9月4日

Claude 模型在 Terminal Bench 4.0 终端编码测试上的得分从42%提升到接近56%

待验证50%
7月22日

在SWE-Bench Pro基准上,Sonnet 5明显落后于Opus 4.8

待验证50%
7月8日

Terminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平

待验证50%

全部知识事实 (10)

来源文章