[控场AI]
概念PRM / Process Reward Model

过程奖励模型

对推理链中每一个中间步骤的质量单独给予奖励信号的模型,是RLHF的进化变体,将奖励信号从结果细化到过程中每一步,对数学、编程等需要严密逻辑链的任务效果尤为突出

时间轴 (近 90 天)

8月23日

OpenAI 在 2023 年发表研究表明,过程奖励模型相比结果监督能显著提升数学推理的可靠性

待验证50%

全部知识事实 (1)

来源文章