待验证50% 置信基准精确时间
可落地的Agent评测门槛包括任务拆解率和工具选择准确率达90%以上、闭环完成率不低于85%、错误恢复率不低于80%
1
来源数
50%
置信度
长期有效
时效性
2026/9/19
首次发现
来源
涉及实体
相关事实
待验证Agent在多步骤任务中存在错误累积效应,每步95%准确率的十步串联后成功率跌至约60%75% 相似待验证斯坦福研究团队在对早期Agent系统评估中发现,单步5%的错误率在10步任务中可导致超过40%的最终失败率74% 相似待验证作者建议Agent的自信度阈值设计为:大于90%自主执行,60%~90%呈现中间状态让用户确认,小于60%强制承认不确定不硬猜73% 相似待验证在实验中,零样本生成任务解决率为17%,通用自我纠错为27%,仅错误反馈为23%,诊断性反例反馈(A-CEGIS)达到90%72% 相似待验证Alto 的优化案例中,目标是首页分数达到90分以上,最多尝试5次,由独立的 Evaluator 检查条件,达标或达到轮次上限才结束72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/934434API
curl https://kongchang.com/api/v1/knowledge/claims/934434MCP
get_claim(id=934434)