概念Vanishing Gradient / 梯度消失问题
梯度消失
深层神经网络训练中的常见问题,当使用Sigmoid、Tanh等激活函数时,梯度(训练信号)在反向传播过程中层层衰减,导致深层网络参数几乎无法更新,是早期深层网络难以训练的主要原因。ReLU激活函数的出现有效缓解了这一问题。
核心事实
时间轴 (近 90 天)
8月29日
Sigmoid函数的导数最大值仅为0.25,经过数十层连乘后梯度会指数级衰减
待验证50%
8月28日
梯度消失问题由Hochreiter在1991年和Bengio等人在1994年正式分析
待验证50%
7月15日
梯度消失问题源于Sigmoid或Tanh等饱和激活函数在输入值较大或较小时导数趋近于零,导致梯度逐层衰减
待验证50%
7月13日
梯度消失是深层神经网络中梯度值在反向传播过程中指数级衰减,导致靠近输入层的参数几乎得不到更新
待验证50%
7月2日
Sigmoid函数存在梯度消失问题:当输入绝对值较大时,其导数趋近于0,导致反向传播时梯度逐层衰减
已验证65%