[控场AI]
概念SFT / Supervised Fine-Tuning

监督微调

使用问答对、指令-响应对等结构化标注数据对模型进行微调,使其学会遵循人类指令的训练方法,是RLHF流程的第一阶段

时间轴 (近 90 天)

8月25日

典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模

待验证50%

全部知识事实 (1)

来源文章