模型蒸馏
一种模型压缩技术,通过将大型教师模型的知识转移到小型学生模型中,在保持性能的同时降低计算成本
核心事实
时间轴 (近 90 天)
通过模型蒸馏、量化(INT8/FP16)等压缩技术可将轻量神经网络(如DistilBERT)参数量降至千万级以下,使其在CPU上达到可接受的推理速度
小模型多是从大模型蒸馏而来,在极小体积里保留了可观的智能水平,使 7B 模型在低配机器上依然实用
模型蒸馏与量化技术使企业可以用小型化模型在本地或私有云完成过去只能依赖大模型API的任务
模型蒸馏使攻击者无需承担原始预训练的数百万美元算力成本,仅需少量 API 调用费和微调算力即可获得近似能力
模型蒸馏是指通过大量查询目标模型、收集其输入输出对,进而训练出能力相近的学生模型
英伟达CEO黄仁勋将AI模型蒸馏定性为一种竞争,而非技术威胁或不正当行为
蒸馏话题在2024-2025年密集进入公众视野
模型蒸馏是深度学习中一种将教师模型的知识迁移到学生模型的技术
攻击者可通过大量 API 调用蒸馏出能力相近的仿制模型,即使无法直接获取权重文件
蒸馏出的小模型可以本地部署、离线运行、单次训练长期使用,边际成本几乎为零
还有 40 条时间轴事件
全部知识事实 (20)
Flash模型通常采用知识蒸馏技术,以旗舰模型为教师模型训练出参数量更小、推理速度更快的学生模型
90%已验证模型蒸馏(Knowledge Distillation)是将大型模型的知识迁移至小型轻量模型的技术,可在参数量缩减数十倍的同时保留大部分性能
80%已验证模型蒸馏是将大模型的能力压缩到小模型中以降低推理成本的技术
80%已验证蒸馏可以让开源团队以远低于从头训练的成本获得接近前沿模型的性能
75%已验证模型蒸馏可在保留70-80%原始性能的前提下将参数量压缩至原来的1/10
75%已验证模型蒸馏将大模型的知识迁移到更小的学生模型中,速度提升显著但存在一定能力损耗
75%已验证模型蒸馏通过温度缩放软化教师模型的softmax输出,使低概率类别信息得以传递给学生模型
70%已验证Knowledge Distillation is a technique for transferring knowledge from a large teacher model to a smaller student model, proposed by Geoffrey Hinton et al. in 2015
70%已验证模型蒸馏技术由Geoffrey Hinton团队于2015年提出,最初用于模型压缩,通过让学生模型拟合教师模型的软标签输出
70%已验证模型蒸馏技术最早由Geoffrey Hinton等人在2015年提出
70%已验证Gemini Flash系列采用知识蒸馏(Knowledge Distillation)、模型量化(Quantization)以及架构裁剪等技术手段来压缩参数规模与计算开销
70%已验证Flash系列通过MoE架构、推测性解码等技术,在每次推理时只激活部分参数以降低计算量
65%已验证硬蒸馏是指学生模型直接学习教师模型的最终输出标签或生成文本,软蒸馏则要求学生模型学习教师模型输出的完整概率分布(logits)
65%已验证微调通常只需原始训练成本的百分之一甚至更少,便能获得接近专用模型的领域表现
65%已验证知识蒸馏的核心思想是让学生模型模仿教师模型输出的软标签(各类别概率分布),软标签被Hinton称为暗知识(dark knowledge)
65%已验证模型蒸馏(Knowledge Distillation)最初由 Hinton 等人于2015年提出,核心思想是让小模型学习大模型的软标签而非硬标签
65%已验证模型蒸馏是一种将大型教师模型能力迁移到更小学生模型的技术,可能被用于扩散危险能力
65%待验证推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
85%待验证业界应对实时推理延迟的主要技术路径包括模型蒸馏、流式解码和专用推理芯片
70%待验证通过蒸馏,参数量仅为教师模型十分之一的学生模型往往能保留教师模型80%-95%的性能
70%