已验证65% 置信事实精确时间
Multi-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制
3
来源数
65%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
15岁少年从零训练200M MoE语言模型:完整架构与实战拆解
redditr/learnmachinelearning2026/7/12
相关事实
待验证标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案75% 相似待验证新内核为滑动窗口注意力(SWA)层提供双输入支持,并引入 attention sinks 机制74% 相似待验证流式处理的解决方案包括因果注意力掩码、chunked attention和look-ahead缓冲74% 相似待验证Multi-Query Attention技术让多个注意力头共享同一组Key和Value投影矩阵,将KV缓存显存需求压缩至原来的1/H,代价是模型表达能力的轻微损失72% 相似已验证多头注意力(Multi-head Attention)通过在不同子空间的并行计算来捕捉多维度语义关系72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/501381API
curl https://kongchang.com/api/v1/knowledge/claims/501381MCP
get_claim(id=501381)