Unverified60% confidenceSolutionExact time
GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用
2
Sources
60%
Confidence
Long-term
Relevance
9/5/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedQwen系列在架构层面引入了GQA(分组查询注意力)机制,相比标准多头注意力降低了KV缓存的内存占用77% similarUnverifiedMeta发布的Llama 3系列采用分组查询注意力机制(GQA),在推理效率上较传统多头注意力有显著提升73% similarUnverifiedMulti-Query Attention技术让多个注意力头共享同一组Key和Value投影矩阵,将KV缓存显存需求压缩至原来的1/H,代价是模型表达能力的轻微损失73% similarVerifiedMulti-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制68% similarUnverifiedFlash Attention通过分块计算减少显存访问次数,MQA和GQA通过共享键值头降低计算开销66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/860211API
curl https://kongchang.com/api/v1/knowledge/claims/860211MCP
get_claim(id=860211)