概念PRM / Process Reward Model
过程奖励模型
对推理链中每一个中间步骤的质量单独给予奖励信号的模型,是RLHF的进化变体,将奖励信号从结果细化到过程中每一步,对数学、编程等需要严密逻辑链的任务效果尤为突出
时间轴 (近 90 天)
8月23日
OpenAI 在 2023 年发表研究表明,过程奖励模型相比结果监督能显著提升数学推理的可靠性
待验证50%
对推理链中每一个中间步骤的质量单独给予奖励信号的模型,是RLHF的进化变体,将奖励信号从结果细化到过程中每一步,对数学、编程等需要严密逻辑链的任务效果尤为突出
OpenAI 在 2023 年发表研究表明,过程奖励模型相比结果监督能显著提升数学推理的可靠性