Unverified50% confidenceFactExact time
对齐训练消除某类有害输出后,模型可能学会更隐晦的表达方式
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified蒸馏训练范式导致开源模型学习到经过高度过滤、几乎不包含失败和纠错过程的数据分布,使模型形成不愿自我纠正的性格78% similarUnverified监督微调训练模型模仿人类标注的正确答案,而强化学习微调让模型通过试错学习最优策略77% similarUnverified如果模型只见过正样本,会倾向于对任何输入都强行调用工具,产生幻觉式调用,负样本帮助模型习得何时不该调用的判断边界76% similarUnverified对齐良好的模型会将元指令引导至合规的创意表达,而对齐不足的模型可能出现意外行为75% similarUnverified当输入约束减少时,机器学习模型会更多地依赖其先验分布,即训练过程中形成的关于某个概念的默认理解75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829363API
curl https://kongchang.com/api/v1/knowledge/claims/829363MCP
get_claim(id=829363)