基准
Terminal-Bench-Science
Terminal-Bench 家族的科学分支,专门用于评估 AI Agent 在真实科研工作流(包括文献调研、数据处理、实验模拟、结果分析等)中的综合能力,以终端环境为载体,支持端到端任务验证
时间轴 (近 90 天)
9月12日
Terminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试
待验证50%
9月12日
Terminal-Bench-Science 是 Terminal-Bench 家族的科学分支
待验证50%
9月12日
Terminal-Bench-Science 将测试任务锚定在具体的科研工作流上,Agent 需在包含真实工具和数据的终端环境中独立完成从问题理解到结果产出的全过程
待验证50%
9月12日
Terminal-Bench-Science 的评测逻辑是端到端的,其产出结果可被自动验证
待验证50%
9月12日
Terminal-Bench-Science 更适合被理解为衡量 AI 辅助科研能力的工具,而非宣告 AI 已能独立开展研究
待验证50%
全部知识事实 (5)
待验证
Terminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试
50%待验证Terminal-Bench-Science 是 Terminal-Bench 家族的科学分支
50%待验证Terminal-Bench-Science 将测试任务锚定在具体的科研工作流上,Agent 需在包含真实工具和数据的终端环境中独立完成从问题理解到结果产出的全过程
50%待验证Terminal-Bench-Science 的评测逻辑是端到端的,其产出结果可被自动验证
50%待验证Terminal-Bench-Science 更适合被理解为衡量 AI 辅助科研能力的工具,而非宣告 AI 已能独立开展研究
50%