待验证50% 置信事实精确时间
Terminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证Terminal-Bench-Science 更适合被理解为衡量 AI 辅助科研能力的工具,而非宣告 AI 已能独立开展研究79% 相似待验证Terminal Bench是用于测量大语言模型和AI Agent在命令行终端环境中真实操作能力的评估基准79% 相似已验证代理化编程强调测试驱动闭环,测试为AI提供明确的成功信号,是AI自我纠错的关键72% 相似待验证AI Skill 可通过解析 OpenAPI/Swagger 文档或接口描述,自动推断参数边界值、生成正负向测试用例,并输出符合 Pytest 或 unittest 规范的可执行脚本71% 相似待验证METR是专注于AI能力评估的研究机构,其发布的任务时长基准测试按人类完成所需时间对软件工程任务分级,让AI代理独立完成并统计成功率71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/912324API
curl https://kongchang.com/api/v1/knowledge/claims/912324MCP
get_claim(id=912324)