概念Multi-Head Attention / 多头自注意力
多头注意力
Transformer架构中的核心组件,通过并行运行多个注意力头从不同子空间捕获序列中的多种依赖关系,是现代大语言模型的基础构件
时间轴 (近 90 天)
9月11日
Transformer原论文使用了八组并行的多头注意力机制
待验证50%
9月11日
在固定算力下,单头注意力比最优设置差0.9分,头太多质量反而会下降
待验证50%
Transformer架构中的核心组件,通过并行运行多个注意力头从不同子空间捕获序列中的多种依赖关系,是现代大语言模型的基础构件
Transformer原论文使用了八组并行的多头注意力机制
在固定算力下,单头注意力比最优设置差0.9分,头太多质量反而会下降