[KongchangAI]
Benchmark

AgentBench

一个多环境综合评估AI智能体的基准,覆盖多种操作环境,以单次任务成功率为核心指标。

Core Facts

Timeline (last 90 days)

Oct 5

AgentBench和ToolBench的测试场景大多仍为预设脚本,与真实生产中工具返回值的不确定性和错误多样性存在明显差距

Unverified50%
Oct 5

WebArena、AgentBench、τ-bench等面向Agent能力的基准测试环境仍以沙盒模拟为主,难以捕捉生产级系统中真实的数据噪声、权限边界、延迟抖动与错误传播链条

Unverified50%
Oct 2

AgentBench是专门针对Agent的基准测试集

Unverified50%
Sep 15

WebArena、ToolBench 和 AgentBench 是当前主流的 AI Agent 基准,分别侧重网页操作、工具调用和多环境综合

Unverified50%
Sep 10

在需要5步以上操作的任务中,最强模型的成功率会从首步的80%以上骤降至后续步骤的40%甚至更低,呈现指数级下降特征

Unverified50%
Sep 10

AgentBench由清华大学等机构的研究团队于2023年提出,论文发表于ICLR 2024,是首个系统性评估LLM作为Agent能力的多维度基准

Unverified50%
Sep 5

智能体评估基准测试套件包括GAIA、AgentBench和SWE-bench

Unverified50%
Jul 17

AgentBench覆盖操作系统、数据库、游戏等8类环境,综合评估Agent的多域适应性

Verified65%

All Facts (8)

Source Articles