ConceptSFT / Supervised Fine-Tuning
监督微调
使用问答对、指令-响应对等结构化标注数据对模型进行微调,使其学会遵循人类指令的训练方法,是RLHF流程的第一阶段
Timeline (last 90 days)
Aug 25
典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模
Unverified50%
使用问答对、指令-响应对等结构化标注数据对模型进行微调,使其学会遵循人类指令的训练方法,是RLHF流程的第一阶段
典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模