Unverified50% confidenceFactExact time
Terminal Bench是斯坦福大学设计的智能体评估框架,模拟真实Linux终端环境,要求智能体完成环境配置、依赖安装、代码调试、结果验证等完整工作流
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
GPT-5.6发布:性能超越竞品却遭政府叫停,网络安全能力触发监管红线
bilibili皮皮蟹勇闯天涯6/27/2026
Related Claims
UnverifiedTerminalBench是一个包含约82个计算机使用和编程任务的Agent评估框架68% similarUnverifiedTerminal-Bench 要求模型在真实的 shell 环境中进行多轮交互,包括发出命令、解析 stdout/stderr 输出、处理权限问题、管理文件系统状态66% similarUnverifiedTerminal Bench要求模型在交互式命令行环境中调试、运行、修复代码,区别于HumanEval等静态代码生成测试64% similarUnverified终端模拟器负责渲染字符、处理键盘输入、管理窗口显示,Shell是运行在终端之上负责解析执行用户命令的程序,两者职责不同58% similarUnverifiedSWE-bench通过Docker容器化技术为每个任务实例创建隔离的运行环境,确保评测的可复现性56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489860API
curl https://kongchang.com/api/v1/knowledge/claims/489860MCP
get_claim(id=489860)