[KongchangAI]
BenchmarkTerminal Bench 2.1

Terminal Bench

专门评估AI在命令行环境中执行复杂任务能力的基准测试,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,2.1版本引入多工具协同维度

Core Facts

Timeline (last 90 days)

Oct 9

在创作者的benchmark中,Haiku 5.5的Terminal Bench成绩从Haiku 4.5的0分提升到接近40%

Unverified50%
Oct 8

在Terminal Bench上Beam约81分垫底,低于DeepSeek 90.6、Kimi 88.3、GLM 88.2、Qwen 86.6

Unverified50%
Oct 7

在Terminal Bench测试中GPT-6.1 Soul的max/high表现几乎与Opus 5.5打平,但每任务成本约$0.96美分,Opus每任务为$0.11到$0.13,价格约为十三分之一

Unverified50%
Oct 3

在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底

Unverified50%
Sep 30

Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4

Unverified50%
Sep 30

在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元

Unverified60%
Sep 29

GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一

Partially Verified65%
Sep 29

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

Verified75%
Sep 26

据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5

Unverified50%
Sep 25

Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力

Unverified50%

28 more timeline events

All Facts (20)

Verified

Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景

90%
Verified

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

75%
Verified

在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%

70%
Verified

在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%

65%
Verified

Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点

65%
Partially Verified

GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一

65%
Unverified

在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元

60%
Unverified

Fable 5.1 在 Terminal Bench Science 0.1 基准测试中得分 52.6%,相比上一代翻了一倍多

60%
Unverified

Qwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)

60%
Unverified

AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景

60%
Unverified

Terminal Bench是斯坦福大学设计的智能体评估框架,模拟真实Linux终端环境,要求智能体完成环境配置、依赖安装、代码调试、结果验证等完整工作流

60%
Unverified

在创作者的benchmark中,Haiku 5.5的Terminal Bench成绩从Haiku 4.5的0分提升到接近40%

50%
Unverified

在Terminal Bench上Beam约81分垫底,低于DeepSeek 90.6、Kimi 88.3、GLM 88.2、Qwen 86.6

50%
Unverified

在Terminal Bench测试中GPT-6.1 Soul的max/high表现几乎与Opus 5.5打平,但每任务成本约$0.96美分,Opus每任务为$0.11到$0.13,价格约为十三分之一

50%
Unverified

在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底

50%
Unverified

Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4

50%
Unverified

据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5

50%
Unverified

Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力

50%
Unverified

在Terminal Bench上,Fable 5.1的分数比Grok 4.7高出约20分,接近50%的提升

50%
Unverified

同一模型在不同harness下运行Terminal Bench,分数从69.8%跨越到74.2%

50%

Source Articles