Unverified50% confidenceFactExact time
Terminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedTerminal-Bench-Science 更适合被理解为衡量 AI 辅助科研能力的工具,而非宣告 AI 已能独立开展研究79% similarUnverifiedTerminal Bench是用于测量大语言模型和AI Agent在命令行终端环境中真实操作能力的评估基准79% similarVerified代理化编程强调测试驱动闭环,测试为AI提供明确的成功信号,是AI自我纠错的关键72% similarUnverifiedAI Skill 可通过解析 OpenAPI/Swagger 文档或接口描述,自动推断参数边界值、生成正负向测试用例,并输出符合 Pytest 或 unittest 规范的可执行脚本71% similarUnverifiedMETR是专注于AI能力评估的研究机构,其发布的任务时长基准测试按人类完成所需时间对软件工程任务分级,让AI代理独立完成并统计成功率71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/912324API
curl https://kongchang.com/api/v1/knowledge/claims/912324MCP
get_claim(id=912324)