Unverified50% confidenceFactExact time
GPT-2引入了Pre-LN(前置层归一化)设计,相比原始Transformer的Post-LN,将LayerNorm置于残差块内部的子层之前,改善了深层网络的梯度流动稳定性
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
UnverifiedTransformer 取代了此前主流的 RNN/LSTM 序列模型,成为 GPT、LLaMA、Claude 等主流大模型的基础结构72% similarVerifiedGPT代表'Generative Pre-trained Transformer'(生成式预训练Transformer)68% similarUnverified现代LLM(如GPT系列、Claude、Llama)均基于Transformer架构,其解码过程本质上是一个马尔可夫链67% similarPartially VerifiedNex N2的输出风格与GPT模型高度相似,暗示其在后训练阶段对GPT风格输出进行了蒸馏67% similarUnverified早期GLM采用了自回归填空(Autoregressive Blank Infilling)架构,与GPT系列的纯自回归架构不同65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/518116API
curl https://kongchang.com/api/v1/knowledge/claims/518116MCP
get_claim(id=518116)