Unverified50% confidenceOpinionExact time
GPT 系列、Llama 等模型的核心能力绝大部分来自预训练而非后续微调阶段
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
UnverifiedGPT系列采用单向(因果)注意力掩码,使模型在预训练阶段每个token只能关注其之前的上下文,与BERT等双向模型形成根本区别81% similarUnverifiedGPT系列模型采用单向自回归预训练,只能看到当前token左侧的历史信息81% similarUnverified学术界多项研究表明GPT-4、LLaMA等主流模型在MMLU、HumanEval、GSM8K等榜单上的高分有相当比例来自训练集与测试集内容重叠77% similarUnverifiedGPT-2确立的BPE分词、Pre-LN归一化、因果掩码自回归训练三大核心设计在GPT-3中被保留并扩展至175B参数77% similarUnverifiedGPT-5.3的自训练突破将自我评估机制扩展到了整个训练数据管道,不仅用于评估,训练材料本身也由模型生成76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/530218API
curl https://kongchang.com/api/v1/knowledge/claims/530218MCP
get_claim(id=530218)