基准
ToolBench
一个面向工具调用任务的AI智能体评估基准,以单次任务成功率为核心指标,评测模型对外部工具的调用能力。
时间轴 (近 90 天)
10月5日
AgentBench和ToolBench的测试场景大多仍为预设脚本,与真实生产中工具返回值的不确定性和错误多样性存在明显差距
待验证50%
9月15日
WebArena、ToolBench 和 AgentBench 是当前主流的 AI Agent 基准,分别侧重网页操作、工具调用和多环境综合
待验证50%
8月23日
UC Berkeley 研究团队在 ToolBench 基准上发现,模型在复杂工具调用链中的幻觉率可达 15-30%
待验证50%
7月17日
ToolBench专注于工具调用能力,包含16000余个真实API
待验证50%