Unverified50% confidenceFactExact time
后训练的最优解是参考分布的指数倾斜,即最优分布密度正比于参考模型密度乘以奖励的指数:π*(x) ∝ π_ref(x) · exp(r(x)/β)
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified后验分布通过贝叶斯定理获得:p(θ|x)∝p(x|θ)·p(θ),将先验知识与数据似然结合71% similarUnverified重参数化技巧将采样表示为 z = μ + σ × ε(ε从标准正态分布采样),使随机性外置于ε,从而让μ和σ的梯度可正常反向传播实现端到端训练68% similarUnverifiedLLM在训练时通过最大化下一个Token的预测概率来优化参数,模型学到的是训练语料的统计分布而非人类的审美判断力66% similarVerified分布偏移是指模型训练时所见数据的统计分布与实际部署环境中数据分布之间的系统性差异66% similarUnverifiedLLM天然倾向于输出最符合训练数据分布的平均化表达,这是AI内容高度同质化的根本原因66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/518181API
curl https://kongchang.com/api/v1/knowledge/claims/518181MCP
get_claim(id=518181)