Unverified50% confidenceFactExact time
RLHF训练中会加入KL散度惩罚项,防止模型偏离SFT阶段学到的基础行为太远
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
UnverifiedRLHF和DPO等对齐技术的效果高度依赖预训练基础质量,预训练阶段未习得的能力几乎无法通过后续对齐补救72% similarVerified当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)71% similarUnverifiedRLHF中非专业标注者更青睐流畅平和的摘要,可能训练模型系统性忽视小概率高风险信息70% similarUnverified强化学习训练比监督学习更不稳定,将NVFP4激进量化引入RL训练会进一步放大固有不稳定性70% similarUnverified当前主流LLM普遍采用预训练加微调范式,先在互联网规模语料上无监督预训练,再通过RLHF等技术对齐人类偏好69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/784174API
curl https://kongchang.com/api/v1/knowledge/claims/784174MCP
get_claim(id=784174)