Unverified50% confidenceBenchmarkExact time
当Agent任务步骤超过10步时,主流大模型的任务完成率会出现非线性下降
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/21/2026
First Seen
Valid until: 10/19/2026
Sources
Related Claims
UnverifiedAI Agent在复杂任务中的典型失败表现包括:在最初十分钟表现良好,半小时后开始偏离目标,两小时后产生完全不可用的输出70% similarUnverified在企业应用中,当构建包含十几个步骤的自动化工作流时,任何被跳过的步骤都可能导致整个流程崩溃,因此模型的指令遵循能力尤为关键69% similarUnverified安装超过100个Agent会导致系统运行缓慢和token消耗爆炸,3-5个职责清晰的Agent优于100个Agent67% similarUnverified以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成67% similarUnverifiedAgent 任务需要模型多轮调用,12B 模型在消费级显卡上单次推理已需数秒,多步任务耗时会显著叠加66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/575925API
curl https://kongchang.com/api/v1/knowledge/claims/575925MCP
get_claim(id=575925)