Unverified50% confidenceFactExact time
新一代基准如AgentBench、GAIA、WebArena开始纳入网页浏览、代码执行、跨工具协作等真实世界任务
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/14/2026
First Seen
Valid until: 10/12/2026
Sources
Related Claims
Unverified交互式Agent基准测试家族包括Terminal-Bench、SWE-bench(软件工程任务)、WebArena(网页操作任务)等74% similarUnverifiedWebArena构建了真实网页环境,测试Agent完成购物、论坛发帖等现实任务的能力73% similarUnverifiedWebArena、OSWorld等前沿学术基准让Agent在真实或模拟的浏览器/操作系统环境中执行完整任务68% similarUnverifiedGAIA将工具使用和多步规划作为一等公民纳入评测设计,这一导向影响了WebArena、AgentBench等后续Agent评测框架66% similarUnverifiedAnythingLLM内置了Agent(智能体)能力,支持工具调用、网页浏览、代码执行等扩展功能66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/504671API
curl https://kongchang.com/api/v1/knowledge/claims/504671MCP
get_claim(id=504671)