[KongchangAI]
ConceptSFT / Supervised Fine-Tuning

监督微调

使用问答对、指令-响应对等结构化标注数据对模型进行微调,使其学会遵循人类指令的训练方法,是RLHF流程的第一阶段

Timeline (last 90 days)

Aug 25

典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模

Unverified50%

All Facts (1)

Source Articles