[控场AI]
基准

Terminal-Bench-Science

Terminal-Bench 家族的科学分支,专门用于评估 AI Agent 在真实科研工作流(包括文献调研、数据处理、实验模拟、结果分析等)中的综合能力,以终端环境为载体,支持端到端任务验证

时间轴 (近 90 天)

9月12日

Terminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试

待验证50%
9月12日

Terminal-Bench-Science 是 Terminal-Bench 家族的科学分支

待验证50%
9月12日

Terminal-Bench-Science 将测试任务锚定在具体的科研工作流上,Agent 需在包含真实工具和数据的终端环境中独立完成从问题理解到结果产出的全过程

待验证50%
9月12日

Terminal-Bench-Science 的评测逻辑是端到端的,其产出结果可被自动验证

待验证50%
9月12日

Terminal-Bench-Science 更适合被理解为衡量 AI 辅助科研能力的工具,而非宣告 AI 已能独立开展研究

待验证50%

全部知识事实 (5)

来源文章