LSTM
长短期记忆网络(Long Short-Term Memory,LSTM)是一种特殊的循环神经网络(RNN)架构,由Hochreiter与Schmidhuber于1997年提出。其核心设计引入输入门、遗忘门和输出门三种门控机制,通过细胞状态选择性地保留或遗忘信息,从而有效缓解传统RNN训练中的梯度消失与梯度爆炸问题,擅长捕捉长距离序列依赖关系,广泛应用于自然语言处理、语音识别和时间序列预测等领域。
核心事实
Transformer的自注意力机制允许模型直接计算序列中任意两个位置之间的依赖关系,突破了RNN/LSTM因顺序计算导致的并行化瓶颈
Transformer架构完全抛弃了循环结构,仅依靠注意力机制处理序列关系,解决了RNN和LSTM存在的梯度消失和无法并行计算的固有缺陷
The self-attention mechanism allows the model to attend to information at all positions simultaneously, eliminating the sequential dependency limitations of RNNs/LSTMs
时间轴 (近 90 天)
NLP领域从词袋模型、TF-IDF发展到RNN、LSTM,再到Transformer架构和大语言模型
传统RNN(包括GRU、LSTM)的核心痛点是历史信息在反向传播时以指数速率衰减,导致梯度消失
循环转移函数采用4门LSTM结构,使用正交初始化,在64维潜空间中驱动状态演化
Tesseract基于LSTM神经网络,支持100多种语言,完全免费且可离线运行
LSTM通过引入遗忘门、输入门和输出门三个门控机制解决长程依赖问题
RNN存在梯度消失和无法并行计算两大硬伤,LSTM和GRU通过门控机制缓解了梯度消失问题
在金融时间序列中信噪比极低,有研究估计金融数据中信号占比可能不足 1%,这使 LSTM 相对更简单模型的优势大打折扣
LSTM 预测曲线「完美贴合」真实价格往往是陷阱,因为最优策略只是滞后一个时间步复制昨天的值,即统计学中的「朴素预测」,无实际预测价值
LSTM和GRU通过门控机制缓解了标准RNN的长程依赖难题
相比RNN和LSTM在长文本中会遗忘前面内容,Transformer所有位置计算可并行执行,训练效率远超RNN和LSTM
还有 14 条时间轴事件
全部知识事实 (20)
Transformer的自注意力机制允许模型直接计算序列中任意两个位置之间的依赖关系,突破了RNN/LSTM因顺序计算导致的并行化瓶颈
80%已验证Transformer架构完全抛弃了循环结构,仅依靠注意力机制处理序列关系,解决了RNN和LSTM存在的梯度消失和无法并行计算的固有缺陷
70%待验证The Transformer's core innovation is the self-attention mechanism, which allows models to attend to all positions in the input simultaneously rather than processing step-by-step like RNNs or LSTMs
100%部分验证The self-attention mechanism allows the model to attend to information at all positions simultaneously, eliminating the sequential dependency limitations of RNNs/LSTMs
65%部分验证Transformer通过自注意力机制让模型处理每个token时能动态关注序列中所有其他token,并实现完全并行化训练
65%待验证LSTM通过引入遗忘门、输入门、输出门三个控制机制,解决了标准RNN在处理长序列时的梯度消失问题
60%待验证与RNN/LSTM架构相比,Transformer在训练时可以高度并行化,使训练数千亿参数的模型成为可能
60%待验证NLP领域从词袋模型、TF-IDF发展到RNN、LSTM,再到Transformer架构和大语言模型
50%待验证传统RNN(包括GRU、LSTM)的核心痛点是历史信息在反向传播时以指数速率衰减,导致梯度消失
50%待验证循环转移函数采用4门LSTM结构,使用正交初始化,在64维潜空间中驱动状态演化
50%待验证Tesseract基于LSTM神经网络,支持100多种语言,完全免费且可离线运行
50%待验证LSTM通过引入遗忘门、输入门和输出门三个门控机制解决长程依赖问题
50%待验证RNN存在梯度消失和无法并行计算两大硬伤,LSTM和GRU通过门控机制缓解了梯度消失问题
50%待验证LSTM 预测曲线「完美贴合」真实价格往往是陷阱,因为最优策略只是滞后一个时间步复制昨天的值,即统计学中的「朴素预测」,无实际预测价值
50%待验证在金融时间序列中信噪比极低,有研究估计金融数据中信号占比可能不足 1%,这使 LSTM 相对更简单模型的优势大打折扣
50%待验证LSTM和GRU通过门控机制缓解了标准RNN的长程依赖难题
50%待验证相比RNN和LSTM在长文本中会遗忘前面内容,Transformer所有位置计算可并行执行,训练效率远超RNN和LSTM
50%待验证解决POMDP的经典方法是维护信念状态(belief state),但在高维空间中计算上不可行;现代深度强化学习通过LSTM或GRU等循环结构隐式维护历史信息
50%待验证LSTM通过门控机制维护隐藏状态解决了简单RNN的梯度消失问题
50%待验证现代深度强化学习通过在策略网络中引入循环结构(如LSTM或GRU)来隐式维护历史信息以处理POMDP
50%