[控场AI]
概念redistributing probability mass

概率质量重新分配

强化学习训练语言模型的核心机制,通过策略梯度等方法根据奖励信号调整模型参数,将概率质量从低回报输出转移到高回报输出,而非创造全新能力

时间轴 (近 90 天)

10月7日

RL训练通过策略梯度等方法将概率质量从普通输出重新分配到优质输出,并不创造全新能力

待验证50%

全部知识事实 (1)

来源文章