概念redistributing probability mass
概率质量重新分配
强化学习训练语言模型的核心机制,通过策略梯度等方法根据奖励信号调整模型参数,将概率质量从低回报输出转移到高回报输出,而非创造全新能力
时间轴 (近 90 天)
10月7日
RL训练通过策略梯度等方法将概率质量从普通输出重新分配到优质输出,并不创造全新能力
待验证50%
强化学习训练语言模型的核心机制,通过策略梯度等方法根据奖励信号调整模型参数,将概率质量从低回报输出转移到高回报输出,而非创造全新能力
RL训练通过策略梯度等方法将概率质量从普通输出重新分配到优质输出,并不创造全新能力