模型蒸馏
一种模型压缩技术,通过将大型教师模型的知识转移到小型学生模型中,在保持性能的同时降低计算成本
Core Facts
Timeline (last 90 days)
RSI与RLHF和模型蒸馏存在本质区别:后两者仍依赖人类反馈信号或教师模型,而RSI强调系统自主生成改进方向
通过模型蒸馏、量化(INT8/FP16)等压缩技术可将轻量神经网络(如DistilBERT)参数量降至千万级以下,使其在CPU上达到可接受的推理速度
小模型多是从大模型蒸馏而来,在极小体积里保留了可观的智能水平,使 7B 模型在低配机器上依然实用
模型蒸馏与量化技术使企业可以用小型化模型在本地或私有云完成过去只能依赖大模型API的任务
模型蒸馏是指通过大量查询目标模型、收集其输入输出对,进而训练出能力相近的学生模型
模型蒸馏使攻击者无需承担原始预训练的数百万美元算力成本,仅需少量 API 调用费和微调算力即可获得近似能力
蒸馏话题在2024-2025年密集进入公众视野
英伟达CEO黄仁勋将AI模型蒸馏定性为一种竞争,而非技术威胁或不正当行为
模型蒸馏是深度学习中一种将教师模型的知识迁移到学生模型的技术
攻击者可通过大量 API 调用蒸馏出能力相近的仿制模型,即使无法直接获取权重文件
40 more timeline events
All Facts (20)
Flash模型通常采用知识蒸馏技术,以旗舰模型为教师模型训练出参数量更小、推理速度更快的学生模型
90%Verified模型蒸馏可在保留70-80%原始性能的前提下将参数量压缩至原来的1/10
80%Verified模型蒸馏(Knowledge Distillation)是将大型模型的知识迁移至小型轻量模型的技术,可在参数量缩减数十倍的同时保留大部分性能
80%Verified模型蒸馏是将大模型的能力压缩到小模型中以降低推理成本的技术
80%Verified蒸馏可以让开源团队以远低于从头训练的成本获得接近前沿模型的性能
75%Verified模型蒸馏将大模型的知识迁移到更小的学生模型中,速度提升显著但存在一定能力损耗
75%Verified模型蒸馏通过温度缩放软化教师模型的softmax输出,使低概率类别信息得以传递给学生模型
70%VerifiedKnowledge Distillation is a technique for transferring knowledge from a large teacher model to a smaller student model, proposed by Geoffrey Hinton et al. in 2015
70%Verified模型蒸馏技术由Geoffrey Hinton团队于2015年提出,最初用于模型压缩,通过让学生模型拟合教师模型的软标签输出
70%Verified模型蒸馏技术最早由Geoffrey Hinton等人在2015年提出
70%VerifiedGemini Flash系列采用知识蒸馏(Knowledge Distillation)、模型量化(Quantization)以及架构裁剪等技术手段来压缩参数规模与计算开销
70%Verified模型蒸馏(Model Distillation)在机器学习领域指用大型教师模型的输出训练小型学生模型,以压缩模型规模同时保留能力
65%VerifiedFlash系列通过MoE架构、推测性解码等技术,在每次推理时只激活部分参数以降低计算量
65%Verified硬蒸馏是指学生模型直接学习教师模型的最终输出标签或生成文本,软蒸馏则要求学生模型学习教师模型输出的完整概率分布(logits)
65%Verified微调通常只需原始训练成本的百分之一甚至更少,便能获得接近专用模型的领域表现
65%Verified知识蒸馏的核心思想是让学生模型模仿教师模型输出的软标签(各类别概率分布),软标签被Hinton称为暗知识(dark knowledge)
65%Verified模型蒸馏(Knowledge Distillation)最初由 Hinton 等人于2015年提出,核心思想是让小模型学习大模型的软标签而非硬标签
65%Verified模型蒸馏是一种将大型教师模型能力迁移到更小学生模型的技术,可能被用于扩散危险能力
65%Unverified推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
85%Unverified业界应对实时推理延迟的主要技术路径包括模型蒸馏、流式解码和专用推理芯片
70%