待验证50% 置信事实时间未知
Prompt中token数量过多会稀释注意力机制的聚焦能力,降低每个描述的实际影响力
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证注意力稀释的根本原因在于Softmax归一化:序列中token越多,每个位置分配到的有效注意力权重随序列长度近似成反比例缩小82% 相似待验证负向提示词包含过多token时,每个token在交叉注意力计算中分到的权重被稀释,导致单个约束的实际抑制效力大幅下降80% 相似待验证当前最前沿模型在处理长程依赖时面临注意力衰减问题,随着上下文长度增加,维持早期设定一致性的能力显著下降77% 相似已验证多头潜在注意力机制(MLA)通过对Key-Value缓存进行低秩压缩,显著降低推理阶段的KV Cache显存占用76% 相似已验证Transformer架构的注意力机制在处理超长序列时,对早期内容的关注度会显著下降,导致模型遗忘前文设定76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/59282API
curl https://kongchang.com/api/v1/knowledge/claims/59282MCP
get_claim(id=59282)