[KongchangAI]
ConceptMulti-Head Attention / 多头注意力

MHA

多头注意力机制,Transformer架构的核心组件,通过多个独立的注意力头并行处理序列信息,每个头维护独立的Key/Value投影,是标准注意力实现方式

Timeline (last 90 days)

Sep 12

GQA相比MHA可将KV缓存体积压缩到四分之一,且不明显损失模型质量

Unverified50%
Sep 12

GQA可将推理时KV Cache显存降低至MHA的1/4,同时保留比MQA更强的建模能力

Unverified50%
Sep 11

MQA将所有Query头共享同一组KV,GQA将若干Query头分为一组共享一组KV,是MHA与MQA的折中方案

Unverified50%
Sep 5

GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用

Unverified60%

All Facts (4)

Source Articles