Unverified50% confidenceFactExact time
SFT源自InstructGPT论文中提出的RLHF流程的第一阶段
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
VerifiedInstructGPT与ChatGPT是RLHF流程的代表性产物77% similarUnverifiedInstructGPT在2022年首次将RLHF大规模应用于GPT-3,直接催生了ChatGPT的诞生72% similarUnverifiedSFT(监督微调)用人工标注的提示-回答对直接优化模型输出分布,InstructGPT、Alpaca等早期指令微调工作均以SFT为核心70% similarUnverifiedSFT(监督微调)是ChatGPT等对话模型训练流程的第一阶段68% similarUnverifiedRLHF成为ChatGPT、Claude等产品的技术基石67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/530575API
curl https://kongchang.com/api/v1/knowledge/claims/530575MCP
get_claim(id=530575)