待验证50% 置信事实精确时间
Terminal-Bench 要求模型在真实的 shell 环境中进行多轮交互,包括发出命令、解析 stdout/stderr 输出、处理权限问题、管理文件系统状态
1
来源数
50%
置信度
长期有效
时效性
2026/8/11
首次发现
来源
相关事实
待验证Terminal Bench要求模型在交互式命令行环境中调试、运行、修复代码,区别于HumanEval等静态代码生成测试70% 相似待验证终端模拟器负责渲染字符、处理键盘输入、管理窗口显示,Shell是运行在终端之上负责解析执行用户命令的程序,两者职责不同69% 相似待验证Terminal Bench是斯坦福大学设计的智能体评估框架,模拟真实Linux终端环境,要求智能体完成环境配置、依赖安装、代码调试、结果验证等完整工作流66% 相似待验证在VS Code中可通过输入/hooks命令并选择continuing terminal在终端中查看配置的Hook66% 相似待验证ShellGPT支持Linux/Unix的管道机制,可以接收其他命令的输出作为上下文进行AI分析64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/729947API
curl https://kongchang.com/api/v1/knowledge/claims/729947MCP
get_claim(id=729947)