SwiGLU
一种结合Swish激活函数与门控线性单元(GLU)的前馈网络激活函数,在多个大语言模型中表现优于ReLU和GeLU,被LLaMA、PaLM等模型采用
时间轴 (近 90 天)
在MoE架构中门控激活调用次数随专家数量线性增长,使得SwiGLU/SiLU计算占比远高于稠密模型
在NVIDIA GB200平台上,路由专家SwiGLU任务完整训练步吞吐提升8.0%,为四个任务中收益最高
不同模型在注意力机制、激活函数、归一化方式上存在差异(如GQA、RoPE、SwiGLU),每种变体都需要运行时框架提供对应算子实现
Agnes-3.0-Flash 前馈网络使用 SwiGLU,中间维度 17408,每层并联一个 2048 维的 SwiGLU 分支
Noam Shazeer的SwiGLU激活函数论文在结论部分将架构成功归功于「神圣的仁慈(divine benevolence)」
该模型架构为交叉注意力 DiT(896 宽 × 16 层),使用 2D RoPE、QK-norm、SwiGLU、adaLN-single
FFN前馈网络模块通过up层将向量升维(如4K→8K),经过激活函数(如SwiGLU门控激活),再通过down层降回原维度
SwiGLU激活函数是现代主流大模型(如LLaMA)采用的前馈网络设计
SwiGLU由Google研究员Noam Shazeer在2020年提出,将Swish激活函数与GLU结合
SwiGLU会增加约50%的前馈层参数量,但在相同计算预算下已被证明能持续提升模型质量,Meta的LLaMA和Google的PaLM均采用
全部知识事实 (10)
在MoE架构中门控激活调用次数随专家数量线性增长,使得SwiGLU/SiLU计算占比远高于稠密模型
50%待验证在NVIDIA GB200平台上,路由专家SwiGLU任务完整训练步吞吐提升8.0%,为四个任务中收益最高
50%待验证不同模型在注意力机制、激活函数、归一化方式上存在差异(如GQA、RoPE、SwiGLU),每种变体都需要运行时框架提供对应算子实现
50%待验证Agnes-3.0-Flash 前馈网络使用 SwiGLU,中间维度 17408,每层并联一个 2048 维的 SwiGLU 分支
50%待验证Noam Shazeer的SwiGLU激活函数论文在结论部分将架构成功归功于「神圣的仁慈(divine benevolence)」
50%待验证该模型架构为交叉注意力 DiT(896 宽 × 16 层),使用 2D RoPE、QK-norm、SwiGLU、adaLN-single
50%待验证FFN前馈网络模块通过up层将向量升维(如4K→8K),经过激活函数(如SwiGLU门控激活),再通过down层降回原维度
50%待验证SwiGLU激活函数是现代主流大模型(如LLaMA)采用的前馈网络设计
50%待验证SwiGLU由Google研究员Noam Shazeer在2020年提出,将Swish激活函数与GLU结合
50%待验证SwiGLU会增加约50%的前馈层参数量,但在相同计算预算下已被证明能持续提升模型质量,Meta的LLaMA和Google的PaLM均采用
50%