[控场AI]
基准Terminal Bench 2.1

Terminal Bench

专门评估AI在命令行环境中执行复杂任务能力的基准测试,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,2.1版本引入多工具协同维度

核心事实

时间轴 (近 90 天)

10月3日

在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底

待验证50%
9月30日

Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4

待验证50%
9月30日

在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元

待验证60%
9月29日

GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一

部分验证65%
9月29日

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

已验证75%
9月26日

据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5

待验证50%
9月25日

Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力

待验证50%
9月25日

在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%

已验证65%
9月25日

在Terminal Bench上,Fable 5.1的分数比Grok 4.7高出约20分,接近50%的提升

待验证50%
9月17日

同一模型在不同harness下运行Terminal Bench,分数从69.8%跨越到74.2%

待验证50%

还有 25 条时间轴事件

全部知识事实 (20)

已验证

Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景

90%
已验证

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

75%
已验证

在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%

70%
已验证

在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%

65%
已验证

Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点

65%
部分验证

GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一

65%
待验证

在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元

60%
待验证

Fable 5.1 在 Terminal Bench Science 0.1 基准测试中得分 52.6%,相比上一代翻了一倍多

60%
待验证

Qwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)

60%
待验证

AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景

60%
待验证

在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底

50%
待验证

Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4

50%
待验证

据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5

50%
待验证

Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力

50%
待验证

在Terminal Bench上,Fable 5.1的分数比Grok 4.7高出约20分,接近50%的提升

50%
待验证

同一模型在不同harness下运行Terminal Bench,分数从69.8%跨越到74.2%

50%
待验证

Terminal Bench是用于测量大语言模型和AI Agent在命令行终端环境中真实操作能力的评估基准

50%
待验证

Terminal Bench代表模型的通用工具使用广度,Finance Agent代表垂直领域专业深度

50%
待验证

Terminal Bench要求模型在Shell环境中执行安装依赖、配置环境、调试程序、管理文件系统和运行脚本等复杂任务

50%
待验证

Terminal Bench检验的是模型能做什么而非知道什么,测量的是模型规划、执行、观察反馈并纠错的完整闭环能力

50%

来源文章