This entity does not have a full profile yet. Below are related knowledge claims.
在Terminal Bench 2.0基准测试中,Composer 2得分为61.7%
90%SupersededComposer 2.5在Terminal Bench 2.0上得分69.3%,与Opus 4.7的69.4%几乎一样
85%SupersededTerminal Bench 2.0是专门针对AI代码代理在真实终端环境中执行任务能力的基准测试框架,模拟开发者在命令行环境中完成端到端任务的全流程
85%Unverified在Terminal Bench 2.0基准测试中,OpenAI 4.6得分为58%,GPT 5.4得分为75.1%
85%UnverifiedM2.7在Terminal Bench 2测试中得分57%
85%Verified在Terminal Bench 2.0测试中,K2.6打出66.7分,比GPT-5.4和Claude Opus 4.6都略高
70%UnverifiedClaude 4.5在Terminal Bench 2.0测试中成功率高出Gemini 3 Pro 5.1%
70%UnverifiedQwen3.6-27B用27B参数量在SWE Bench Verified、SWE Bench Pro、Terminal Bench 2.0等多项基准测试中超越了前代397B MOE旗舰模型的性能
60%UnverifiedComposer 2.5在Terminal Bench 2.0、Suite Bench Multilingual和Cursor Bench等基准测试中,某些测试上已超越Opus和GPT 5.5
60%SupersededGPT-5.5在Terminal Bench 2.0基准测试上超越了Claude尚未发布的新模型
60%