Verified65% confidenceFactExact time
Self-Attention的核心公式为Attention(Q,K,V) = softmax(QKᵀ/√dk)V,除以√dk是为了缓解点积值过大导致的梯度消失问题
3
Sources
65%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
AI应用开发工程师核心能力拆解:从入门到工业级落地
bilibiliAI大模型-开发7/11/2026
Related Claims
VerifiedTransformer架构的自注意力机制核心计算公式为 Attention(Q,K,V) = softmax(QKᵀ/√d_k)V,softmax函数将所有位置的注意力分数归一化为总和为1的概率分布77% similarUnverified标准 Scaled Dot-Product Attention 中 Q 与 K 做矩阵乘法得到 n×n 注意力分数矩阵,计算量为 O(n²·d)74% similarUnverified自注意力权重通过Softmax函数归一化,权重总和恒为173% similarUnverifiedTransformer架构中的自注意力(Self-Attention)层通过Softmax函数对所有位置的相关性分数进行归一化,当序列长度从几千Token膨胀到数万Token时,每个位置分配到的注意力权重被大幅稀释70% similarUnverifiedSelf-Attention的核心操作是计算查询向量与键向量之间的点积相似度,再以此为权重对值向量进行加权求和68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/500052API
curl https://kongchang.com/api/v1/knowledge/claims/500052MCP
get_claim(id=500052)