基准Terminal-Bench
Terminal-Bench 4.0
面向真实工程任务的编程能力基准,侧重评估在终端环境中完成多步骤命令行任务的能力,衡量编程Agent的实际可用性
时间轴 (近 90 天)
9月28日
Terminal-Bench 4.0 版本相比之前增加了多步骤依赖任务和故障恢复场景
待验证50%
9月28日
GPT-6 Astra 在 Terminal-Bench 4.0 和 OSWorld 2.0 基准上刷新了成绩
待验证50%
9月16日
官方声称 Weave Router 2.0 在 Terminal-Bench 4.0 和 SWE-Atlas 基准上表现可匹敌 GPT-6 Astra,但成本只有一半、速度快一倍
待验证50%