Softmax
Softmax是一种数学激活函数,能够将一组任意实数向量转换为概率分布,使所有输出值介于0到1之间且总和为1。其核心机制是对每个输入值取指数后再归一化,从而突出较大值之间的差异。Softmax广泛应用于机器学习和深度神经网络中,尤其常作为多分类模型的输出层激活函数,用于表达模型对各类别的预测置信度。
核心事实
时间轴 (近 90 天)
分类头通常是一个简单的全连接层加Softmax激活,将高维特征向量映射到各类别的概率分布
Decoder 场景下需引入 Mask 矩阵,将当前词之后的位置赋值为负无穷,经 Softmax 后趋近于 0,形成因果生成效果
VQ 训练中逐步退火 tau 参数,并用 Softmax 保证所有量化档位持续接收梯度
在标准Transformer架构中,Softmax操作负责将注意力分数归一化为概率分布,决定每个token对其他token的关注程度
Softmax涉及指数运算、逐行归一化以及全局依赖,难以并行化和量化,在长序列场景下尤其消耗资源
静态收缩(Static Contraction)指用预先确定的、结构化的张量收缩操作来替代或规避运行时的动态Softmax归一化
Softmax提供的非线性归一化和竞争性注意力分配是Transformer表现优异的重要原因之一
嵌入层的作用是将 token 映射为向量,注意力机制计算 token 之间的关联,Softmax 将分数转化为概率
采样逻辑(Top-K、Top-P、Softmax)在CPU上执行,由于只处理单个概率向量(约200KB数据),耗时通常小于5ms
CLIP使用softmax进行全局归一化,当批次中存在多个合理正样本对时,会人为降低这些正样本的概率,可能导致次优表示
还有 4 条时间轴事件
全部知识事实 (14)
自注意力权重通过Softmax函数归一化,权重总和恒为1
70%待验证分类头通常是一个简单的全连接层加Softmax激活,将高维特征向量映射到各类别的概率分布
50%待验证Decoder 场景下需引入 Mask 矩阵,将当前词之后的位置赋值为负无穷,经 Softmax 后趋近于 0,形成因果生成效果
50%待验证VQ 训练中逐步退火 tau 参数,并用 Softmax 保证所有量化档位持续接收梯度
50%待验证在标准Transformer架构中,Softmax操作负责将注意力分数归一化为概率分布,决定每个token对其他token的关注程度
50%待验证Softmax涉及指数运算、逐行归一化以及全局依赖,难以并行化和量化,在长序列场景下尤其消耗资源
50%待验证静态收缩(Static Contraction)指用预先确定的、结构化的张量收缩操作来替代或规避运行时的动态Softmax归一化
50%待验证Softmax提供的非线性归一化和竞争性注意力分配是Transformer表现优异的重要原因之一
50%待验证嵌入层的作用是将 token 映射为向量,注意力机制计算 token 之间的关联,Softmax 将分数转化为概率
50%待验证采样逻辑(Top-K、Top-P、Softmax)在CPU上执行,由于只处理单个概率向量(约200KB数据),耗时通常小于5ms
50%待验证CLIP使用softmax进行全局归一化,当批次中存在多个合理正样本对时,会人为降低这些正样本的概率,可能导致次优表示
50%待验证Softmax函数对每个值取指数然后除以所有指数值的总和,确保输出的所有值都在0到1之间且总和为1
50%待验证Softmax 数值稳定的标准做法是减去最大值,计算 exp(x_i - max(x)) 而非 exp(x_i),在数学上等价但避免上溢
50%待验证softmax操作在处理极端值时容易因精度不足产生数值溢出或下溢,这是早期FP8量化效果不理想的核心技术原因
50%