[KongchangAI]
Benchmark终端基准

Terminal Benchmark

评估AI模型在命令行/Shell环境中完成真实系统交互任务的综合基准,涵盖文件操作、脚本执行、包管理、进程控制等能力,用于衡量模型的Agent式操作能力

Core Facts

Timeline (last 90 days)

Sep 29

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

Verified75%
Sep 29

终端基准通常指模型在命令行/Shell环境中完成任务的综合评分,涵盖文件操作、脚本执行、包管理、进程控制等系统交互能力

Unverified50%

All Facts (2)

Source Articles