[KongchangAI]
ConceptPRM / Process Reward Model

过程奖励模型

对推理链中每一个中间步骤的质量单独给予奖励信号的模型,是RLHF的进化变体,将奖励信号从结果细化到过程中每一步,对数学、编程等需要严密逻辑链的任务效果尤为突出

Timeline (last 90 days)

Aug 23

OpenAI 在 2023 年发表研究表明,过程奖励模型相比结果监督能显著提升数学推理的可靠性

Unverified50%

All Facts (1)

Source Articles