待验证50% 置信事实精确时间
Terminal Bench是用于测量大语言模型和AI Agent在命令行终端环境中真实操作能力的评估基准
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证Terminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试79% 相似待验证AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景69% 相似待验证AI终端助手具有上下文感知能力,能够读取当前目录结构、Git状态等信息以生成更精确的命令,这与纯聊天式AI不同68% 相似已验证Aider is a command-line AI coding tool targeting developers who prefer terminal operations67% 相似待验证AI护栏是指在大语言模型的输入和输出端部署的安全检测与内容过滤机制66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/910359API
curl https://kongchang.com/api/v1/knowledge/claims/910359MCP
get_claim(id=910359)