待验证50% 置信事实精确时间
新一代基准如AgentBench、GAIA、WebArena开始纳入网页浏览、代码执行、跨工具协作等真实世界任务
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/14
首次发现
有效期至:2026/10/12
来源
相关事实
待验证交互式Agent基准测试家族包括Terminal-Bench、SWE-bench(软件工程任务)、WebArena(网页操作任务)等74% 相似待验证WebArena构建了真实网页环境,测试Agent完成购物、论坛发帖等现实任务的能力73% 相似待验证WebArena、OSWorld等前沿学术基准让Agent在真实或模拟的浏览器/操作系统环境中执行完整任务68% 相似待验证GAIA将工具使用和多步规划作为一等公民纳入评测设计,这一导向影响了WebArena、AgentBench等后续Agent评测框架66% 相似待验证AnythingLLM内置了Agent(智能体)能力,支持工具调用、网页浏览、代码执行等扩展功能66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/504671API
curl https://kongchang.com/api/v1/knowledge/claims/504671MCP
get_claim(id=504671)