待验证50% 置信观点精确时间
Softmax提供的非线性归一化和竞争性注意力分配是Transformer表现优异的重要原因之一
1
来源数
50%
置信度
长期有效
时效性
2026/9/14
首次发现
来源
涉及实体
相关事实
待验证Transformer架构中的自注意力(Self-Attention)层通过Softmax函数对所有位置的相关性分数进行归一化,当序列长度从几千Token膨胀到数万Token时,每个位置分配到的注意力权重被大幅稀释74% 相似已验证Transformer架构的注意力机制中,序列长度增加时早期token的注意力得分在softmax归一化后被后续token稀释,形成注意力沉没效应72% 相似已验证Transformer架构的自注意力机制核心计算公式为 Attention(Q,K,V) = softmax(QKᵀ/√d_k)V,softmax函数将所有位置的注意力分数归一化为总和为1的概率分布72% 相似待验证DeepMind的GTrXL(Gated Transformer-XL)和Decision Transformer展示了注意力机制在长程依赖建模上的优势71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/921182API
curl https://kongchang.com/api/v1/knowledge/claims/921182MCP
get_claim(id=921182)