Unverified60% confidenceFactExact time
注意力稀释的根本原因在于Softmax归一化:序列中token越多,每个位置分配到的有效注意力权重随序列长度近似成反比例缩小
2
Sources
60%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
Harness Engineering:企业级AI Agent落地的六层工程体系
bilibili赋范大模型课堂7/8/2026
Related Claims
UnverifiedPrompt中token数量过多会稀释注意力机制的聚焦能力,降低每个描述的实际影响力82% similarVerifiedAttention公式中除以√d_k的原因是防止点积过大导致softmax梯度消失79% similarVerified多头潜在注意力机制(MLA)通过对Key-Value缓存进行低秩压缩,显著降低推理阶段的KV Cache显存占用76% similarUnverifiedMulti-head Latent Attention通过将KV缓存压缩到低维潜在空间中,大幅降低推理时的显存占用和计算开销76% similarUnverified模型在大海捞针测试中对中间位置信息的检索能力明显弱于首尾位置,这被称为注意力沉降现象75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/404581API
curl https://kongchang.com/api/v1/knowledge/claims/404581MCP
get_claim(id=404581)