Unverified50% confidenceFactTime unknown
SFT(监督微调)训练的模型存在'模仿天花板',其表现上限受限于标注数据的质量和多样性
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
强化学习驱动AI推理进化:从模仿者到真正的思考者
bilibili小也的AI日记
Related Claims
Verified大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐76% similarUnverifiedSFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问75% similarUnverified跨模型引用行为差异的根源包括预训练语料差异、SFT数据集差异和RLHF阶段人类标注者群体差异71% similarUnverified后训练通常涵盖监督微调(SFT)、强化学习对齐(RLHF/RLAIF)以及领域适配微调,视觉推理模型还涉及视觉指令微调71% similarUnverified对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/61061API
curl https://kongchang.com/api/v1/knowledge/claims/61061MCP
get_claim(id=61061)