待验证50% 置信事实精确时间
Terminal Bench要求模型在交互式命令行环境中调试、运行、修复代码,区别于HumanEval等静态代码生成测试
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
GPT-5.6发布:Soul/Terra/Luna三层布局,编排能力训入模型
bilibili杨博士说AI2026/6/29
相关事实
待验证Terminal-Bench 要求模型在真实的 shell 环境中进行多轮交互,包括发出命令、解析 stdout/stderr 输出、处理权限问题、管理文件系统状态70% 相似已验证SWE-bench要求模型在给定完整代码仓库上下文情况下自动生成能通过测试的补丁代码67% 相似待验证Terminal Bench是斯坦福大学设计的智能体评估框架,模拟真实Linux终端环境,要求智能体完成环境配置、依赖安装、代码调试、结果验证等完整工作流64% 相似待验证代理编程工具能够自主读写文件、调用终端命令、运行测试并根据结果迭代修改,整个过程几乎不需要人工干预每一步63% 相似待验证批量处理场景应确认软件支持命令行/脚本调用或队列处理功能,逐张手动导出会成为工作流瓶颈,专业级软件通常支持自动化批处理和预设应用63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/248694API
curl https://kongchang.com/api/v1/knowledge/claims/248694MCP
get_claim(id=248694)