待验证50% 置信事实精确时间
Anagnorisis 的反馈循环在机器学习中对应主动学习(Active Learning)与人在回路(HITL)两个研究方向
1
来源数
50%
置信度
长期有效
时效性
2026/9/1
首次发现
来源
涉及实体
相关事实
待验证反馈循环指模型预测影响用户行为、用户行为又成为下一轮训练数据形成闭环,处理不当会放大偏差并造成模型自我强化的恶性循环66% 相似已验证认知科学研究表明,费曼学习法的有效性源于'生成效应'(Generation Effect)——主动输出比被动输入能形成更强的记忆编码66% 相似已验证奖励模型的训练可使用Bradley-Terry模型等排序学习框架,训练神经网络预测任意两个回答之间的人类偏好概率,接收(prompt, response)对并输出标量分数65% 相似待验证监督微调训练模型模仿人类标注的正确答案,而强化学习微调让模型通过试错学习最优策略65% 相似待验证自动化评估器在强化学习中称为奖励函数,在进化计算中称为适应度函数64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/838720API
curl https://kongchang.com/api/v1/knowledge/claims/838720MCP
get_claim(id=838720)