待验证90% 置信事实时间未知
GQA(Grouped-Query Attention)和MQA(Multi-Query Attention)是MLA之前业界通过共享Key/Value头来缓解KV缓存问题的方案
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
DeepSeek-V3.2-Exp发现RoPE实现Bug:交错格式不匹配导致推理性能下降
twitterdeepseek_ai
涉及实体
相关事实
已验证分组查询注意力(GQA)和多查询注意力(MQA)通过让多个Query头共享同一组Key/Value头减小推理时KV Cache显存占用,是Llama 3、Mistral等模型的标配优化77% 相似待验证GQA让多个查询头共享同一组键值头,Llama 2 70B 和 Llama 3 系列均采用了 GQA70% 相似待验证QKV分别代表Query(查询)、Key(键)和Value(值),命名借鉴自信息检索系统概念62% 相似待验证自注意力通过将输入序列映射为查询Q、键K、值V三组向量,计算Q与K的点积相似度后经Softmax归一化得到注意力权重,再加权汇聚V向量59% 相似待验证MQA令所有查询头共享同一组Key-Value以压缩KV Cache56% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/27886API
curl https://kongchang.com/api/v1/knowledge/claims/27886MCP
get_claim(id=27886)