Reflective Recovery
一种用于增强大语言模型推理能力的自监督微调方法,通过提取失败推理轨迹的初始片段作为训练数据,使模型学会识别并纠正推理过程中的错误,无需依赖外部评判模型或强化学习框架
时间轴 (近 90 天)
arXiv论文(arXiv:2609.19156)提出了Reflective Recovery方法
Reflective Recovery是一种自监督方法,将模型失败的推理尝试转化为恢复训练数据
使用Reflective Recovery,DeepSeek-R1-Distill-Qwen-7B在AIME 2025上准确率从30.0%提升至37.5%
Reflective Recovery方法打破了Scaling Collapse的壁垒
经过Reflective Recovery训练的模型展现出涌现式的自我纠错行为(emergent self-correction)
论文作者将这一转变概括为从outcome-oriented memorization转向process-oriented reflective reasoning
Reflective Recovery的思路在强化学习领域类似于利用失败轨迹进行离轨策略(off-policy)学习
该工作目前仍是学术预印本,在更大规模模型与更广泛任务上的泛化能力有待后续研究验证
全部知识事实 (8)
该工作目前仍是学术预印本,在更大规模模型与更广泛任务上的泛化能力有待后续研究验证
50%待验证Reflective Recovery是一种自监督方法,将模型失败的推理尝试转化为恢复训练数据
50%待验证使用Reflective Recovery,DeepSeek-R1-Distill-Qwen-7B在AIME 2025上准确率从30.0%提升至37.5%
50%待验证Reflective Recovery方法打破了Scaling Collapse的壁垒
50%待验证经过Reflective Recovery训练的模型展现出涌现式的自我纠错行为(emergent self-correction)
50%待验证论文作者将这一转变概括为从outcome-oriented memorization转向process-oriented reflective reasoning
50%待验证Reflective Recovery的思路在强化学习领域类似于利用失败轨迹进行离轨策略(off-policy)学习
50%待验证arXiv论文(arXiv:2609.19156)提出了Reflective Recovery方法
50%