Unverified50% confidenceOpinionExact time
RL训练通过策略梯度等方法将概率质量从普通输出重新分配到优质输出,并不创造全新能力
1
Sources
50%
Confidence
Long-term
Relevance
10/7/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRL阶段每一步训练需要同时运行推理(生成rollout)和反向传播(更新权重),因此算力需求远高于普通微调79% similarVerifiedLLM在训练时通过最大化下一个Token的预测概率来优化参数,模型学到的是训练语料的统计分布而非人类的审美判断力76% similarUnverifiedRLCD通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布,在无需人工标注奖励的场景下具有优势74% similarUnverifiedRLCD是作者自称的(非官方命名)基于策略梯度的强化学习方法,针对严格正确评分规则优化决策模型,只有当模型输出数学上校准的概率时才获得最大奖励74% similarUnverifiedPPO与RLCD两套方案都试图脱离自回归范式、用强化学习产出结构化的概率或置信度输出73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/984829API
curl https://kongchang.com/api/v1/knowledge/claims/984829MCP
get_claim(id=984829)