已验证65% 置信事实精确时间
Attention公式中除以√d_k的原因是防止点积过大导致softmax梯度消失
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证注意力稀释的根本原因在于Softmax归一化:序列中token越多,每个位置分配到的有效注意力权重随序列长度近似成反比例缩小79% 相似待验证计算 softmax 函数时指数运算可能导致浮点数溢出,标准做法是先减去输入向量的最大值再取指数68% 相似待验证Prompt中token数量过多会稀释注意力机制的聚焦能力,降低每个描述的实际影响力67% 相似待验证缩放点积将点积除以√d(d为嵌入维度),使点积方差保持在合理范围,让Softmax输出更平滑的概率分布以稳定训练66% 相似已验证多头潜在注意力机制(MLA)通过对Key-Value缓存进行低秩压缩,显著降低推理阶段的KV Cache显存占用65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/42572API
curl https://kongchang.com/api/v1/knowledge/claims/42572MCP
get_claim(id=42572)