Unverified50% confidenceOpinionExact time
过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点
1
Sources
50%
Confidence
Long-term
Relevance
9/7/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedSFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出72% similarUnverified标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间71% similarUnverified离线RL的核心挑战是分布偏移,可能导致外推误差,使学到的策略在部署时表现远不如预期65% similarUnverifiedRRF对各路检索的原始分数分布不敏感,相比简单的线性加权在混合检索场景中更加鲁棒64% similarUnverified仅靠微调阶段的RLHF或许永远无法产生真正鲁棒的安全对齐62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/873213API
curl https://kongchang.com/api/v1/knowledge/claims/873213MCP
get_claim(id=873213)