[控场AI]
概念反思式恢复

Reflective Recovery

一种用于增强大语言模型推理能力的自监督微调方法,通过提取失败推理轨迹的初始片段作为训练数据,使模型学会识别并纠正推理过程中的错误,无需依赖外部评判模型或强化学习框架

时间轴 (近 90 天)

9月18日

arXiv论文(arXiv:2609.19156)提出了Reflective Recovery方法

待验证50%
9月18日

Reflective Recovery是一种自监督方法,将模型失败的推理尝试转化为恢复训练数据

待验证50%
9月18日

使用Reflective Recovery,DeepSeek-R1-Distill-Qwen-7B在AIME 2025上准确率从30.0%提升至37.5%

待验证50%
9月18日

Reflective Recovery方法打破了Scaling Collapse的壁垒

待验证50%
9月18日

经过Reflective Recovery训练的模型展现出涌现式的自我纠错行为(emergent self-correction)

待验证50%
9月18日

论文作者将这一转变概括为从outcome-oriented memorization转向process-oriented reflective reasoning

待验证50%
9月18日

Reflective Recovery的思路在强化学习领域类似于利用失败轨迹进行离轨策略(off-policy)学习

待验证50%
9月18日

该工作目前仍是学术预印本,在更大规模模型与更广泛任务上的泛化能力有待后续研究验证

待验证50%

全部知识事实 (8)

来源文章