待验证60% 置信事实时间未知
SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问
2
来源数
60%
置信度
长期有效
时效性
2026/6/3
首次发现
来源
大模型训练全流程解析:预训练、SFT微调与偏好对齐通俗详解
bilibili小全栈
涉及实体
相关事实
待验证分散损失不改变模型架构,也不增加推理阶段的计算负担,仅在训练阶段作为辅助损失发挥作用76% 相似待验证SFT(监督微调)训练的模型存在'模仿天花板',其表现上限受限于标注数据的质量和多样性75% 相似待验证对比学习通过构造正样本对和负样本对训练模型,SimCSE通过对同一句子应用不同Dropout掩码生成正样本对,无需人工标注70% 相似待验证微软BitNet等研究表明,若从预训练阶段采用1Bit量化感知训练(QAT),精度损失可控,而事后量化(PTQ)损失通常更大69% 相似待验证对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/39837API
curl https://kongchang.com/api/v1/knowledge/claims/39837MCP
get_claim(id=39837)