基准终端基准
Terminal Benchmark
评估AI模型在命令行/Shell环境中完成真实系统交互任务的综合基准,涵盖文件操作、脚本执行、包管理、进程控制等能力,用于衡量模型的Agent式操作能力
核心事实
时间轴 (近 90 天)
9月29日
Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
已验证75%
9月29日
终端基准通常指模型在命令行/Shell环境中完成任务的综合评分,涵盖文件操作、脚本执行、包管理、进程控制等系统交互能力
待验证50%