待验证60% 置信事实精确时间
TerminalBench是一个包含约82个计算机使用和编程任务的Agent评估框架
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Pi编程Agent深度解析:为何抛弃主流AI工具从零自建
bilibili63号炼金工坊2026/6/3
相关事实
待验证Terminal Bench是斯坦福大学设计的智能体评估框架,模拟真实Linux终端环境,要求智能体完成环境配置、依赖安装、代码调试、结果验证等完整工作流68% 相似待验证Terminal Bench要求模型在交互式命令行环境中调试、运行、修复代码,区别于HumanEval等静态代码生成测试60% 相似待验证新兴智能体评估框架包括AgentBench、WebArena、SWE-bench,分别针对工具调用、网页操作、代码修复场景58% 相似待验证Terminal-Bench 要求模型在真实的 shell 环境中进行多轮交互,包括发出命令、解析 stdout/stderr 输出、处理权限问题、管理文件系统状态58% 相似待验证The architecture of terminal AI coding tools typically includes a session management layer, a model invocation layer, a tool execution layer, and a permission control layer57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/43520API
curl https://kongchang.com/api/v1/knowledge/claims/43520MCP
get_claim(id=43520)