待验证50% 置信事实精确时间
Reflective Recovery是一种自监督方法,将模型失败的推理尝试转化为恢复训练数据
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证自我反思通过让模型评估自身输出质量并迭代改进来实现,Reflexion框架展示了Agent可以从失败尝试中学习并在下一轮迭代中调整策略68% 相似待验证分布漂移是行为克隆的核心缺陷,因训练数据全部来自正确操作轨迹,模型未见过犯错后如何恢复的场景67% 相似待验证修复层采用「先确定性修复错误数据再附上修复提示」的策略,利用模型的in-context learning能力完成行为校正67% 相似待验证REVERSAL-BENCH提供了一个基于真值的重置预言机(reset oracle),用于判断某个状态是否真正可以被恢复65% 相似待验证ReAct范式通过强制要求每次工具调用后观察真实环境反馈,将推理链锚定在可验证的现实结果上,抑制错误累积64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931200API
curl https://kongchang.com/api/v1/knowledge/claims/931200MCP
get_claim(id=931200)