[控场AI]
概念Vanishing Gradient / 梯度消失问题

梯度消失

深层神经网络训练中的常见问题,当使用Sigmoid、Tanh等激活函数时,梯度(训练信号)在反向传播过程中层层衰减,导致深层网络参数几乎无法更新,是早期深层网络难以训练的主要原因。ReLU激活函数的出现有效缓解了这一问题。

核心事实

时间轴 (近 90 天)

8月29日

Sigmoid函数的导数最大值仅为0.25,经过数十层连乘后梯度会指数级衰减

待验证50%
8月28日

梯度消失问题由Hochreiter在1991年和Bengio等人在1994年正式分析

待验证50%
7月15日

梯度消失问题源于Sigmoid或Tanh等饱和激活函数在输入值较大或较小时导数趋近于零,导致梯度逐层衰减

待验证50%
7月13日

梯度消失是深层神经网络中梯度值在反向传播过程中指数级衰减,导致靠近输入层的参数几乎得不到更新

待验证50%
7月2日

Sigmoid函数存在梯度消失问题:当输入绝对值较大时,其导数趋近于0,导致反向传播时梯度逐层衰减

已验证65%

全部知识事实 (5)

来源文章