Terminal Bench 4.0
专门评估AI模型在终端环境中执行编程任务能力的基准测试套件,重点考察命令行操作、脚本编写、代码调试及自动化工作流等真实开发场景表现
核心事实
时间轴 (近 90 天)
Opus 5.5 在 Terminal Bench 4.0 测试中表现超过了 Astra 和 Fable 5.1
在 Terminal Bench 4.0 最高难度设置下,Sonnet 5.5 的表现超过 Opus 5.5
在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%
在Terminal Bench 4.0上,Astra成本约10.35美元,Fable 5.1约19.50美元
在Terminal Bench 4.0最高精度测试中,Fable 5.1准确率为55.8%,成本为19.50美元;Astra准确率为56.7%,成本为10.35美元
Claude 模型在 Terminal Bench 4.0 终端编码测试上的得分从42%提升到接近56%
在SWE-Bench Pro基准上,Sonnet 5明显落后于Opus 4.8
Terminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平
全部知识事实 (10)
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
90%已验证在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%
65%待验证在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
60%待验证在Terminal Bench 4.0最高精度测试中,Fable 5.1准确率为55.8%,成本为19.50美元;Astra准确率为56.7%,成本为10.35美元
60%待验证Opus 5.5 在 Terminal Bench 4.0 测试中表现超过了 Astra 和 Fable 5.1
50%待验证在 Terminal Bench 4.0 最高难度设置下,Sonnet 5.5 的表现超过 Opus 5.5
50%待验证在Terminal Bench 4.0上,Astra成本约10.35美元,Fable 5.1约19.50美元
50%待验证Claude 模型在 Terminal Bench 4.0 终端编码测试上的得分从42%提升到接近56%
50%待验证在SWE-Bench Pro基准上,Sonnet 5明显落后于Opus 4.8
50%待验证Terminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平
50%