Unverified50% confidenceBenchmarkExact time
斯坦福研究团队在对早期Agent系统评估中发现,单步5%的错误率在10步任务中可导致超过40%的最终失败率
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/8/2026
First Seen
Valid until: 10/6/2026
Sources
元认知反馈:用强化学习让大模型准确表达不确定性
hackernewshackernews7/7/2026
Related Claims
UnverifiedAgent在多步骤任务中存在错误累积效应,每步95%准确率的十步串联后成功率跌至约60%78% similarUnverified2023年斯坦福研究显示,在需要连续多步决策的任务中,现有Agent系统的成功率随步骤数呈指数级下降76% similarUnverified斯坦福大学人机交互研究组实验显示,即便自动化系统建议明显错误,参与者采纳错误建议的概率仍高达60%以上76% similarVerified在长链路任务中,若每一步约5%的错误率,经过20步后整体成功率可能跌至不足36%75% similarUnverified斯坦福大学的AgentBench基准测试(2023年)量化证明,在复杂多步骤任务中纯ReAct范式的成功率往往不超过30%73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/279896API
curl https://kongchang.com/api/v1/knowledge/claims/279896MCP
get_claim(id=279896)