微调(Fine-tuning)是机器学习中的一种迁移学习技术,指在已完成预训练的大规模模型基础上,使用特定任务或领域的标注数据对模型参数进行进一步训练和调整,使其适配目标场景。微调通常只需较少的数据和计算资源,即可使通用模型在文本分类、问答、图像识别等具体任务上显著提升性能,是当前自然语言处理和计算机视觉领域的主流模型适配方法。
在垂直领域(如法律、医疗)表现不佳时,通过收集高质量问答数据进行微调往往比无限优化Prompt更有效且更可持续
研究表明仅用1,000条高质量指令数据就能显著提升模型的指令遵循能力
微调一个7B参数的模型可能需要数十GB显存进行全参数微调
MIMO 2.5在代码生成领域针对性地进行了指令微调(Instruction Fine-tuning)
业界探索的思考力度校准方向包括基于强化学习训练模型的元认知能力、通过监督微调学习推理深度分布、以及设计动态停止机制