待验证50% 置信事实精确时间
Terminal-Bench 属于交互式Agent基准测试家族,与SWE-bench、WebArena等评测共同构成AI Agent能力的多维评估体系
1
来源数
50%
置信度
长期有效
时效性
2026/8/11
首次发现
来源
相关事实
待验证交互式Agent基准测试家族包括Terminal-Bench、SWE-bench(软件工程任务)、WebArena(网页操作任务)等80% 相似待验证IAB(Intelligent Agent Benchmarking)workshop聚焦智能体评估68% 相似待验证AgentBench覆盖操作系统、数据库、游戏等8类环境,综合评估Agent的多域适应性67% 相似待验证功能测试基于浏览器自动化框架(如Playwright或Puppeteer)让AI Agent自主执行预设测试用例66% 相似待验证AgentBench是针对LLM Agent的新一代基准,从工具使用准确率、多轮对话连贯性、跨场景泛化能力等多维度评估模型表现66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/730038API
curl https://kongchang.com/api/v1/knowledge/claims/730038MCP
get_claim(id=730038)