ConceptPRM / Process Reward Model
过程奖励模型
对推理链中每一个中间步骤的质量单独给予奖励信号的模型,是RLHF的进化变体,将奖励信号从结果细化到过程中每一步,对数学、编程等需要严密逻辑链的任务效果尤为突出
Timeline (last 90 days)
Aug 23
OpenAI 在 2023 年发表研究表明,过程奖励模型相比结果监督能显著提升数学推理的可靠性
Unverified50%
对推理链中每一个中间步骤的质量单独给予奖励信号的模型,是RLHF的进化变体,将奖励信号从结果细化到过程中每一步,对数学、编程等需要严密逻辑链的任务效果尤为突出
OpenAI 在 2023 年发表研究表明,过程奖励模型相比结果监督能显著提升数学推理的可靠性