[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
SFT / Supervised Fine-Tuning
监督微调
使用问答对、指令-响应对等结构化标注数据对模型进行微调,使其学会遵循人类指令的训练方法,是RLHF流程的第一阶段
时间轴 (近 90 天)
8月25日
典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模
待验证
50%
全部知识事实 (1)
待验证
典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模
50%
来源文章
本地小模型成为软件专家?RAG架构实战方案解析
7月16日