Unverified50% confidenceFactExact time
自注意力权重通过Softmax函数归一化,权重总和恒为1
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
VerifiedTransformer架构的自注意力机制核心计算公式为 Attention(Q,K,V) = softmax(QKᵀ/√d_k)V,softmax函数将所有位置的注意力分数归一化为总和为1的概率分布78% similarUnverifiedTransformer架构中的自注意力(Self-Attention)层通过Softmax函数对所有位置的相关性分数进行归一化,当序列长度从几千Token膨胀到数万Token时,每个位置分配到的注意力权重被大幅稀释77% similarVerifiedSelf-Attention的核心公式为Attention(Q,K,V) = softmax(QKᵀ/√dk)V,除以√dk是为了缓解点积值过大导致的梯度消失问题73% similarUnverified标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案72% similarUnverified标准自注意力的计算复杂度为序列长度的平方,实现百万Token上下文需引入稀疏注意力、滑动窗口注意力及KV Cache压缩等技术69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/530705API
curl https://kongchang.com/api/v1/knowledge/claims/530705MCP
get_claim(id=530705)