Unverified50% confidenceFactExact time
Terminal Bench是用于测量大语言模型和AI Agent在命令行终端环境中真实操作能力的评估基准
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedTerminal-Bench-Science 是一个专门用于评估 AI Agent 在真实科研工作流中表现的基准测试79% similarUnverifiedAI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景69% similarUnverifiedAI终端助手具有上下文感知能力,能够读取当前目录结构、Git状态等信息以生成更精确的命令,这与纯聊天式AI不同68% similarVerifiedAider is a command-line AI coding tool targeting developers who prefer terminal operations67% similarUnverifiedAI护栏是指在大语言模型的输入和输出端部署的安全检测与内容过滤机制66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/910359API
curl https://kongchang.com/api/v1/knowledge/claims/910359MCP
get_claim(id=910359)