Verified75% confidenceFactExact time
RL阶段每一步训练需要同时运行推理(生成rollout)和反向传播(更新权重),因此算力需求远高于普通微调
3
Sources
75%
Confidence
Long-term
Relevance
9/18/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRL训练通过策略梯度等方法将概率质量从普通输出重新分配到优质输出,并不创造全新能力79% similarUnverified现代推理模型普遍采用RLHF或其变体RLAIF进行对齐训练,模型在训练中学会何时停止推理、何时输出答案78% similarUnverified全参数RL训练的大范围参数更新提供了隐式正则化效果,可能是鲁棒性的来源77% similarUnverified主流代码大模型均采用「预训练+指令微调」的两阶段策略,第二阶段通过RLHF或DPO等对齐技术76% similarUnverified提示词与模型版本存在深度绑定关系,不同版本模型在RLHF训练数据、指令微调策略上的差异会导致相同提示词产生不同输出,这种现象被称为「提示词漂移」76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/930927API
curl https://kongchang.com/api/v1/knowledge/claims/930927MCP
get_claim(id=930927)