[控场AI]
基准终端基准

Terminal Benchmark

评估AI模型在命令行/Shell环境中完成真实系统交互任务的综合基准,涵盖文件操作、脚本执行、包管理、进程控制等能力,用于衡量模型的Agent式操作能力

核心事实

时间轴 (近 90 天)

9月29日

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

已验证75%
9月29日

终端基准通常指模型在命令行/Shell环境中完成任务的综合评分,涵盖文件操作、脚本执行、包管理、进程控制等系统交互能力

待验证50%

全部知识事实 (2)

来源文章