[控场AI]
基准TerminalBench 2.1

TerminalBench

AI能力评测基准,GPT-5.6 Sol在此达到业界最佳水平

时间轴 (近 90 天)

9月16日

现有主流智能体评测基准(如Web Arena、SWE-Bench、Gaia、TerminalBench)大多假设一个静态环境,在评测过程中环境不变

待验证50%

全部知识事实 (1)

来源文章