BenchmarkTerminal-Bench / Terminal-Bench 2.1
Terminal Bench 2.0
Terminal Bench 2.0 是一个用于评估人工智能模型在终端环境下编程与操作能力的基准测试框架,属于第二个主要版本迭代。该基准测试通过设计一系列涉及命令行操作、脚本编写、系统交互等任务,衡量模型在真实终端场景中的代码生成、调试与执行能力,旨在为不同AI系统的终端操作性能提供标准化的横向比较依据。
Core Facts
Timeline (last 90 days)
May 31
Gemini 3.1 Pro在SWE Bench Pro上得分54.2
Unverified60%
May 31
Composer 2.5在Cursor Bench V3.1上得分63.2%,Opus 4.7在默认配置下为61.6%,GPT 5.5为59.2%
Verified75%