待验证75% 置信事实时间未知
Kwan Ma团队2025年7月发布的测评报告显示,随着输入Token数量增加,几乎所有主流模型在简单任务上的表现都会下降
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
AI Agent模型分层路由策略:Token成本、幻觉应对与选型实战
bilibili前端小卒
涉及实体
相关事实
部分验证2023年斯坦福大学Nelson Liu等人的研究发现,当关键信息被放置在长上下文的中间位置时,模型性能可下降超过20%72% 相似待验证大模型的性能提升已经明显放缓,最近新版本的评分甚至不一定超越之前的模型,能力基本已定型65% 相似待验证研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点64% 相似待验证斯坦福大学2023年发布的Lost in the Middle研究(Liu et al.)显示,当关键信息位于上下文中间段时,模型检索准确率相比头部和尾部下降约20-30个百分点,且在上下文超过32K token时尤为显著64% 相似待验证研究表明在超过8-10轮对话后,模型对初始系统提示中规则的遵循率可下降20%-40%63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/27302API
curl https://kongchang.com/api/v1/knowledge/claims/27302MCP
get_claim(id=27302)