概念Multi-Head Attention / 多头注意力
MHA
多头注意力机制,Transformer架构的核心组件,通过多个独立的注意力头并行处理序列信息,每个头维护独立的Key/Value投影,是标准注意力实现方式
时间轴 (近 90 天)
9月12日
GQA相比MHA可将KV缓存体积压缩到四分之一,且不明显损失模型质量
待验证50%
9月12日
GQA可将推理时KV Cache显存降低至MHA的1/4,同时保留比MQA更强的建模能力
待验证50%
9月11日
MQA将所有Query头共享同一组KV,GQA将若干Query头分为一组共享一组KV,是MHA与MQA的折中方案
待验证50%
9月5日
GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用
待验证60%