[控场AI]
概念知识蒸馏 / Knowledge Distillation

模型蒸馏

一种模型压缩技术,通过将大型教师模型的知识转移到小型学生模型中,在保持性能的同时降低计算成本

核心事实

时间轴 (近 90 天)

8月28日

降低大模型转写延迟的优化手段包括模型蒸馏、推测解码、KV-cache 优化、硬件加速(如 TPU v5e)及流式 chunked attention

待验证50%
8月28日

模型蒸馏通过温度缩放软化教师模型的softmax输出,使低概率类别信息得以传递给学生模型

待验证50%
8月28日

模型蒸馏可在保持80%-90%代码生成质量的同时将推理成本降低一个数量级

待验证50%
8月28日

厂商推出的mini或lite版本模型通常是蒸馏技术的产物,可将推理成本降低一个数量级

待验证50%
8月4日

Knowledge Distillation is a technique for transferring knowledge from a large teacher model to a smaller student model, proposed by Geoffrey Hinton et al. in 2015

已验证70%
7月17日

模型蒸馏技术由Geoffrey Hinton团队于2015年提出,最初用于模型压缩,通过让学生模型拟合教师模型的软标签输出

已验证65%
7月14日

知识蒸馏的核心思想是让学生模型模仿教师模型输出的软标签(各类别概率分布),软标签被Hinton称为暗知识(dark knowledge)

已验证65%
7月11日

可利用大模型(如GPT-4)基于领域文档自动生成合成训练数据,降低标注成本

待验证50%
5月31日

Gemini Flash系列采用知识蒸馏(Knowledge Distillation)、模型量化(Quantization)以及架构裁剪等技术手段来压缩参数规模与计算开销

待验证70%

全部知识事实 (9)

来源文章