[控场AI]
概念Multi-Head Attention / 多头注意力

MHA

多头注意力机制,Transformer架构的核心组件,通过多个独立的注意力头并行处理序列信息,每个头维护独立的Key/Value投影,是标准注意力实现方式

时间轴 (近 90 天)

9月12日

GQA相比MHA可将KV缓存体积压缩到四分之一,且不明显损失模型质量

待验证50%
9月12日

GQA可将推理时KV Cache显存降低至MHA的1/4,同时保留比MQA更强的建模能力

待验证50%
9月11日

MQA将所有Query头共享同一组KV,GQA将若干Query头分为一组共享一组KV,是MHA与MQA的折中方案

待验证50%
9月5日

GQA(分组查询注意力)是介于多头注意力(MHA)和多查询注意力(MQA)之间的注意力机制,通过将多个 Query 头分组共享 Key-Value 投影来减少 KV Cache 显存占用

待验证60%

全部知识事实 (4)

来源文章