Terminal Bench
专门评估AI在命令行环境中执行复杂任务能力的基准测试,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,2.1版本引入多工具协同维度
核心事实
时间轴 (近 90 天)
在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底
Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4
在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一
Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5
Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力
在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%
在Terminal Bench上,Fable 5.1的分数比Grok 4.7高出约20分,接近50%的提升
同一模型在不同harness下运行Terminal Bench,分数从69.8%跨越到74.2%
还有 25 条时间轴事件
全部知识事实 (20)
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
90%已验证Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
75%已验证在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%
70%已验证在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%
65%已验证Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点
65%部分验证GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一
65%待验证在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
60%待验证Fable 5.1 在 Terminal Bench Science 0.1 基准测试中得分 52.6%,相比上一代翻了一倍多
60%待验证Qwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)
60%待验证AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景
60%待验证在4个智能体编码测试中,Argon赢了两个,Frontier SWE和Terminal Bench两个测试中垫底
50%待验证Claude Opus 5.5 在 Terminal Bench 上的得分约为 66.4
50%待验证据官方口径,V4.1 Flash在Terminal Bench 2.1、DeepSWE 1.1、CyberGym、HLE、Automation Bench、Agent's Last Exam等多个基准测试上成绩超过GPT-5.6 SOAR和Opus 5
50%待验证Terminal Bench专注衡量agentic编程能力,即模型自主在终端环境中规划、执行并验证多步骤任务的能力
50%待验证在Terminal Bench上,Fable 5.1的分数比Grok 4.7高出约20分,接近50%的提升
50%待验证同一模型在不同harness下运行Terminal Bench,分数从69.8%跨越到74.2%
50%待验证Terminal Bench是用于测量大语言模型和AI Agent在命令行终端环境中真实操作能力的评估基准
50%待验证Terminal Bench代表模型的通用工具使用广度,Finance Agent代表垂直领域专业深度
50%待验证Terminal Bench要求模型在Shell环境中执行安装依赖、配置环境、调试程序、管理文件系统和运行脚本等复杂任务
50%待验证Terminal Bench检验的是模型能做什么而非知道什么,测量的是模型规划、执行、观察反馈并纠错的完整闭环能力
50%