Unverified50% confidenceOpinionExact time
Terminal Bench检验的是模型能做什么而非知道什么,测量的是模型规划、执行、观察反馈并纠错的完整闭环能力
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedTerminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景79% similarUnverifiedTerminal-Bench-Science 将测试任务锚定在具体的科研工作流上,Agent 需在包含真实工具和数据的终端环境中独立完成从问题理解到结果产出的全过程74% similarUnverified斯坦福的IFEval、清华的FollowBench是评估模型指令遵循能力的基准测试69% similarUnverified原版 Terminal-Bench 聚焦于命令行操作评测69% similarUnverified智能体工程强调Plan-Change-Test-Verify循环,验证步骤能让智能体自行检查工作是否正常运行,失败时回到规划阶段68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/910361API
curl https://kongchang.com/api/v1/knowledge/claims/910361MCP
get_claim(id=910361)