[控场AI]
基准

ToolBench

一个面向工具调用任务的AI智能体评估基准,以单次任务成功率为核心指标,评测模型对外部工具的调用能力。

时间轴 (近 90 天)

10月5日

AgentBench和ToolBench的测试场景大多仍为预设脚本,与真实生产中工具返回值的不确定性和错误多样性存在明显差距

待验证50%
9月15日

WebArena、ToolBench 和 AgentBench 是当前主流的 AI Agent 基准,分别侧重网页操作、工具调用和多环境综合

待验证50%
8月23日

UC Berkeley 研究团队在 ToolBench 基准上发现,模型在复杂工具调用链中的幻觉率可达 15-30%

待验证50%
7月17日

ToolBench专注于工具调用能力,包含16000余个真实API

待验证50%

全部知识事实 (4)

来源文章