Unverified50% confidenceBenchmarkExact time
即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/25/2026
First Seen
Valid until: 10/23/2026
Sources
Related Claims
Unverified当链路节点超过5个时,Agent系统整体成功率往往不足60%77% similarUnverifiedAgent在多步骤任务中存在错误累积效应,每步95%准确率的十步串联后成功率跌至约60%74% similarUnverified一个连续调用5个API的任务,即使每步成功率为95%,整体成功率也会降至约77%72% similarUnverified斯坦福大学的AgentBench基准测试(2023年)量化证明,在复杂多步骤任务中纯ReAct范式的成功率往往不超过30%70% similarUnverifiedHermes Agent的Skill机制将20步任务压缩为5步经过验证的高效路径后,整体成功率从36%跃升至77%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/613465API
curl https://kongchang.com/api/v1/knowledge/claims/613465MCP
get_claim(id=613465)