[控场AI]
基准Terminal-Bench

Terminal-Bench 4.0

面向真实工程任务的编程能力基准,侧重评估在终端环境中完成多步骤命令行任务的能力,衡量编程Agent的实际可用性

时间轴 (近 90 天)

9月28日

Terminal-Bench 4.0 版本相比之前增加了多步骤依赖任务和故障恢复场景

待验证50%
9月28日

GPT-6 Astra 在 Terminal-Bench 4.0 和 OSWorld 2.0 基准上刷新了成绩

待验证50%
9月16日

官方声称 Weave Router 2.0 在 Terminal-Bench 4.0 和 SWE-Atlas 基准上表现可匹敌 GPT-6 Astra,但成本只有一半、速度快一倍

待验证50%

全部知识事实 (3)

来源文章