Unverified50% confidenceFactTime unknown
Prompt中token数量过多会稀释注意力机制的聚焦能力,降低每个描述的实际影响力
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified注意力稀释的根本原因在于Softmax归一化:序列中token越多,每个位置分配到的有效注意力权重随序列长度近似成反比例缩小82% similarUnverified负向提示词包含过多token时,每个token在交叉注意力计算中分到的权重被稀释,导致单个约束的实际抑制效力大幅下降80% similarUnverified当前最前沿模型在处理长程依赖时面临注意力衰减问题,随着上下文长度增加,维持早期设定一致性的能力显著下降77% similarVerified多头潜在注意力机制(MLA)通过对Key-Value缓存进行低秩压缩,显著降低推理阶段的KV Cache显存占用76% similarVerifiedTransformer架构的注意力机制在处理超长序列时,对早期内容的关注度会显著下降,导致模型遗忘前文设定76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/59282API
curl https://kongchang.com/api/v1/knowledge/claims/59282MCP
get_claim(id=59282)