待验证60% 置信解决方案精确时间
GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用
2
来源数
60%
置信度
长期有效
时效性
2026/9/5
首次发现
来源
涉及实体
相关事实
已验证Qwen系列在架构层面引入了GQA(分组查询注意力)机制,相比标准多头注意力降低了KV缓存的内存占用77% 相似待验证Meta发布的Llama 3系列采用分组查询注意力机制(GQA),在推理效率上较传统多头注意力有显著提升73% 相似待验证Multi-Query Attention技术让多个注意力头共享同一组Key和Value投影矩阵,将KV缓存显存需求压缩至原来的1/H,代价是模型表达能力的轻微损失73% 相似已验证Multi-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制68% 相似待验证Flash Attention通过分块计算减少显存访问次数,MQA和GQA通过共享键值头降低计算开销66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/860211API
curl https://kongchang.com/api/v1/knowledge/claims/860211MCP
get_claim(id=860211)