Verified90% confidenceFactTime unknown
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
16
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Gemini 3.5 Flash深度解析:Google打造的AI Agent执行引擎
twitterJeffDean
Related Entities
Related Claims
UnverifiedTerminal Bench检验的是模型能做什么而非知道什么,测量的是模型规划、执行、观察反馈并纠错的完整闭环能力79% similarUnverified原版 Terminal-Bench 聚焦于命令行操作评测75% similarUnverifiedTerminal-Bench-Science 将测试任务锚定在具体的科研工作流上,Agent 需在包含真实工具和数据的终端环境中独立完成从问题理解到结果产出的全过程75% similarUnverified测试 Skill 由一个目录结构、一份描述文件以及具体的执行脚本组成70% similarUnverifiedτ2-bench是专门评估大模型工具调用能力的基准测试,模拟真实世界中智能体需要处理的复杂多步工具调用场景69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/17832API
curl https://kongchang.com/api/v1/knowledge/claims/17832MCP
get_claim(id=17832)