待验证50% 置信事实精确时间
预训练和SFT只提供正向监督,而DPO及RL相邻技术提供负向监督的杠杆,能降低错误序列的概率
1
来源数
50%
置信度
长期有效
时效性
2026/10/3
首次发现
来源
涉及实体
相关事实
待验证点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练77% 相似待验证相比全量预训练,SFT 所需的数据量和算力要小得多,但仍需要 GPU 集群、分布式训练框架以及检查点管理和实验追踪能力76% 相似待验证RLHF和DPO等对齐技术的效果高度依赖预训练基础质量,预训练阶段未习得的能力几乎无法通过后续对齐补救73% 相似已验证SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问72% 相似已验证从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/969751API
curl https://kongchang.com/api/v1/knowledge/claims/969751MCP
get_claim(id=969751)