Verified65% confidenceFactExact time
Multi-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制
3
Sources
65%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
15岁少年从零训练200M MoE语言模型:完整架构与实战拆解
redditr/learnmachinelearning7/12/2026
Related Claims
Unverified标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案75% similarUnverified新内核为滑动窗口注意力(SWA)层提供双输入支持,并引入 attention sinks 机制74% similarUnverified流式处理的解决方案包括因果注意力掩码、chunked attention和look-ahead缓冲74% similarUnverifiedMulti-Query Attention技术让多个注意力头共享同一组Key和Value投影矩阵,将KV缓存显存需求压缩至原来的1/H,代价是模型表达能力的轻微损失72% similarVerified多头注意力(Multi-head Attention)通过在不同子空间的并行计算来捕捉多维度语义关系72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/501381API
curl https://kongchang.com/api/v1/knowledge/claims/501381MCP
get_claim(id=501381)