待验证50% 置信事实精确时间
原版 Terminal-Bench 聚焦于命令行操作评测
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
已验证Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景75% 相似待验证Terminal Bench检验的是模型能做什么而非知道什么,测量的是模型规划、执行、观察反馈并纠错的完整闭环能力69% 相似待验证Terminal-Bench-Science 的评测逻辑是端到端的,其产出结果可被自动验证65% 相似待验证官方给出了针对Terminal Bench 2.1、SWE Bench Verified/Pro以及CLAW Eval等多个基准的评测数据56% 相似待验证DiscoBench的评测框架从任务效用、歧义检测能力、交互策略、成本效率四个维度评估56% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/912328API
curl https://kongchang.com/api/v1/knowledge/claims/912328MCP
get_claim(id=912328)