Unverified50% confidenceFactExact time
Reflexion(2023)提出用语言反馈替代数值奖励,让Agent用自然语言总结失败经验并存入记忆
1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
UnverifiedReflexion框架通过让Agent生成自然语言经验总结,以言语强化学习替代传统奖励信号83% similarUnverified语境诱发幻觉源自RLHF对用户满意度的优化,因纠正用户错误观念比顺从预设更易引发负面反馈从而被抑制61% similarUnverifiedReflexion在HumanEval编程基准上将通过率从80%提升至91%61% similarUnverified反馈形式以机身小屏幕柱状图为主,缺乏游戏化或丰富的可视化软件界面,对于需要趣味性反馈来维持训练动力的患者(尤其儿童或认知障碍患者)吸引力有限61% similarUnverified强化学习的核心机制源自行为心理学中的操作性条件反射理论,智能体通过接收奖励或惩罚信号来调整行为策略61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/590008API
curl https://kongchang.com/api/v1/knowledge/claims/590008MCP
get_claim(id=590008)