ConceptMulti-Head Attention / 多头注意力
MHA
多头注意力机制,Transformer架构的核心组件,通过多个独立的注意力头并行处理序列信息,每个头维护独立的Key/Value投影,是标准注意力实现方式
Timeline (last 90 days)
Sep 12
GQA相比MHA可将KV缓存体积压缩到四分之一,且不明显损失模型质量
Unverified50%
Sep 12
GQA可将推理时KV Cache显存降低至MHA的1/4,同时保留比MQA更强的建模能力
Unverified50%
Sep 11
MQA将所有Query头共享同一组KV,GQA将若干Query头分为一组共享一组KV,是MHA与MQA的折中方案
Unverified50%
Sep 5
GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用
Unverified60%