待验证50% 置信事实精确时间
Terminal-Bench-Science 将测试任务锚定在具体的科研工作流上,Agent 需在包含真实工具和数据的终端环境中独立完成从问题理解到结果产出的全过程
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
已验证Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景75% 相似待验证Terminal Bench检验的是模型能做什么而非知道什么,测量的是模型规划、执行、观察反馈并纠错的完整闭环能力74% 相似待验证真实任务评估的技术挑战包括每个智能体需在独立沙盒环境中运行、模拟真实软件环境、防止智能体相互干扰,以及同一任务多路径下的完成判定验证逻辑73% 相似待验证该测试Agent工作流覆盖从需求分析到自动化代码生成的完整工作流程72% 相似待验证测试 Skill 由一个目录结构、一份描述文件以及具体的执行脚本组成71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/912326API
curl https://kongchang.com/api/v1/knowledge/claims/912326MCP
get_claim(id=912326)