AgentBench
一个多环境综合评估AI智能体的基准,覆盖多种操作环境,以单次任务成功率为核心指标。
Core Facts
Timeline (last 90 days)
AgentBench和ToolBench的测试场景大多仍为预设脚本,与真实生产中工具返回值的不确定性和错误多样性存在明显差距
WebArena、AgentBench、τ-bench等面向Agent能力的基准测试环境仍以沙盒模拟为主,难以捕捉生产级系统中真实的数据噪声、权限边界、延迟抖动与错误传播链条
AgentBench是专门针对Agent的基准测试集
WebArena、ToolBench 和 AgentBench 是当前主流的 AI Agent 基准,分别侧重网页操作、工具调用和多环境综合
在需要5步以上操作的任务中,最强模型的成功率会从首步的80%以上骤降至后续步骤的40%甚至更低,呈现指数级下降特征
AgentBench由清华大学等机构的研究团队于2023年提出,论文发表于ICLR 2024,是首个系统性评估LLM作为Agent能力的多维度基准
智能体评估基准测试套件包括GAIA、AgentBench和SWE-bench
AgentBench覆盖操作系统、数据库、游戏等8类环境,综合评估Agent的多域适应性
All Facts (8)
AgentBench覆盖操作系统、数据库、游戏等8类环境,综合评估Agent的多域适应性
65%UnverifiedAgentBench和ToolBench的测试场景大多仍为预设脚本,与真实生产中工具返回值的不确定性和错误多样性存在明显差距
50%UnverifiedWebArena、AgentBench、τ-bench等面向Agent能力的基准测试环境仍以沙盒模拟为主,难以捕捉生产级系统中真实的数据噪声、权限边界、延迟抖动与错误传播链条
50%UnverifiedAgentBench是专门针对Agent的基准测试集
50%UnverifiedWebArena、ToolBench 和 AgentBench 是当前主流的 AI Agent 基准,分别侧重网页操作、工具调用和多环境综合
50%UnverifiedAgentBench由清华大学等机构的研究团队于2023年提出,论文发表于ICLR 2024,是首个系统性评估LLM作为Agent能力的多维度基准
50%Unverified在需要5步以上操作的任务中,最强模型的成功率会从首步的80%以上骤降至后续步骤的40%甚至更低,呈现指数级下降特征
50%Unverified智能体评估基准测试套件包括GAIA、AgentBench和SWE-bench
50%