Unverified50% confidenceFactExact time
监督微调训练模型模仿人类标注的正确答案,而强化学习微调让模型通过试错学习最优策略
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Andrew Ng's New Course Explained: A Practical Guide to Using OpenAI's O1 Reasoning Model
bilibili吴恩达智能体6/13/2026
Related Claims
VerifiedHuman-in-the-Loop概念源自控制论和机器学习领域,最初指人类在模型训练过程中提供反馈以改善模型性能78% similarUnverified修复层采用「先确定性修复错误数据再附上修复提示」的策略,利用模型的in-context learning能力完成行为校正77% similarUnverified若训练数据完全由正样本构成,模型会倾向于对任何输入都强行调用工具,产生幻觉式调用77% similarVerified确认偏误与RLHF(基于人类反馈的强化学习)训练方式相关,模型被优化为生成让人满意的回答76% similarUnverified推理范式本质上是将强化学习应用于语言模型的后训练阶段,让模型自主探索推理路径并根据答案正确性获得奖励反馈,最早在o1系列模型中公开展示76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/47317API
curl https://kongchang.com/api/v1/knowledge/claims/47317MCP
get_claim(id=47317)