待验证50% 置信事实精确时间
交互式Agent基准测试家族包括Terminal-Bench、SWE-bench(软件工程任务)、WebArena(网页操作任务)等
1
来源数
50%
置信度
长期有效
时效性
2026/8/11
首次发现
来源
相关事实
待验证Terminal-Bench 属于交互式Agent基准测试家族,与SWE-bench、WebArena等评测共同构成AI Agent能力的多维评估体系80% 相似待验证新一代基准如AgentBench、GAIA、WebArena开始纳入网页浏览、代码执行、跨工具协作等真实世界任务74% 相似待验证功能测试基于浏览器自动化框架(如Playwright或Puppeteer)让AI Agent自主执行预设测试用例71% 相似待验证WebArena构建了真实网页环境,测试Agent完成购物、论坛发帖等现实任务的能力70% 相似待验证Applitools、Testim、mabl 等测试平台也在积极探索 AI Agent 应用于软件测试的方向67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/729948API
curl https://kongchang.com/api/v1/knowledge/claims/729948MCP
get_claim(id=729948)