待验证50% 置信观点精确时间
GPT 系列、Llama 等模型的核心能力绝大部分来自预训练而非后续微调阶段
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
待验证GPT系列采用单向(因果)注意力掩码,使模型在预训练阶段每个token只能关注其之前的上下文,与BERT等双向模型形成根本区别81% 相似待验证GPT系列模型采用单向自回归预训练,只能看到当前token左侧的历史信息81% 相似待验证学术界多项研究表明GPT-4、LLaMA等主流模型在MMLU、HumanEval、GSM8K等榜单上的高分有相当比例来自训练集与测试集内容重叠77% 相似待验证GPT-2确立的BPE分词、Pre-LN归一化、因果掩码自回归训练三大核心设计在GPT-3中被保留并扩展至175B参数77% 相似待验证GPT-5.3的自训练突破将自我评估机制扩展到了整个训练数据管道,不仅用于评估,训练材料本身也由模型生成76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/530218API
curl https://kongchang.com/api/v1/knowledge/claims/530218MCP
get_claim(id=530218)