Terminal Bench
专门评估AI在命令行环境中执行复杂任务能力的基准测试,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,2.1版本引入多工具协同维度
Core Facts
Timeline (last 90 days)
在创作者的benchmark中,Haiku 5.5的Terminal Bench成绩从Haiku 4.5的0分提升到接近40%
在Terminal Bench上Beam约81分垫底,低于DeepSeek 90.6、Kimi 88.3、GLM 88.2、Qwen 86.6
在Terminal Bench测试中GPT-6.1 Soul的max/high表现几乎与Opus 5.5打平,但每任务成本约$0.96美分,Opus每任务为$0.11到$0.13,价格约为十三分之一
在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底
Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4
在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一
Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5
Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力
28 more timeline events
All Facts (20)
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
90%VerifiedClaude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
75%Verified在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%
70%Verified在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%
65%VerifiedClaude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点
65%Partially VerifiedGPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一
65%Unverified在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
60%UnverifiedFable 5.1 在 Terminal Bench Science 0.1 基准测试中得分 52.6%,相比上一代翻了一倍多
60%UnverifiedQwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)
60%UnverifiedAI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景
60%UnverifiedTerminal Bench是斯坦福大学设计的智能体评估框架,模拟真实Linux终端环境,要求智能体完成环境配置、依赖安装、代码调试、结果验证等完整工作流
60%Unverified在创作者的benchmark中,Haiku 5.5的Terminal Bench成绩从Haiku 4.5的0分提升到接近40%
50%Unverified在Terminal Bench上Beam约81分垫底,低于DeepSeek 90.6、Kimi 88.3、GLM 88.2、Qwen 86.6
50%Unverified在Terminal Bench测试中GPT-6.1 Soul的max/high表现几乎与Opus 5.5打平,但每任务成本约$0.96美分,Opus每任务为$0.11到$0.13,价格约为十三分之一
50%Unverified在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底
50%UnverifiedClaude Opus 5.5 在 Terminal Bench 上的得分约为 66.4
50%Unverified据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5
50%UnverifiedTerminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力
50%Unverified在Terminal Bench上,Fable 5.1的分数比Grok 4.7高出约20分,接近50%的提升
50%Unverified同一模型在不同harness下运行Terminal Bench,分数从69.8%跨越到74.2%
50%