待验证50% 置信事实精确时间
GPT-2引入了Pre-LN(前置层归一化)设计,相比原始Transformer的Post-LN,将LayerNorm置于残差块内部的子层之前,改善了深层网络的梯度流动稳定性
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证Transformer 取代了此前主流的 RNN/LSTM 序列模型,成为 GPT、LLaMA、Claude 等主流大模型的基础结构72% 相似已验证GPT代表'Generative Pre-trained Transformer'(生成式预训练Transformer)68% 相似待验证现代LLM(如GPT系列、Claude、Llama)均基于Transformer架构,其解码过程本质上是一个马尔可夫链67% 相似部分验证Nex N2的输出风格与GPT模型高度相似,暗示其在后训练阶段对GPT风格输出进行了蒸馏67% 相似待验证早期GLM采用了自回归填空(Autoregressive Blank Infilling)架构,与GPT系列的纯自回归架构不同65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/518116API
curl https://kongchang.com/api/v1/knowledge/claims/518116MCP
get_claim(id=518116)