模型蒸馏
一种模型压缩技术,通过将大型教师模型的知识转移到小型学生模型中,在保持性能的同时降低计算成本
核心事实
Knowledge Distillation is a technique for transferring knowledge from a large teacher model to a smaller student model, proposed by Geoffrey Hinton et al. in 2015
模型蒸馏技术由Geoffrey Hinton团队于2015年提出,最初用于模型压缩,通过让学生模型拟合教师模型的软标签输出
知识蒸馏的核心思想是让学生模型模仿教师模型输出的软标签(各类别概率分布),软标签被Hinton称为暗知识(dark knowledge)
时间轴 (近 90 天)
降低大模型转写延迟的优化手段包括模型蒸馏、推测解码、KV-cache 优化、硬件加速(如 TPU v5e)及流式 chunked attention
模型蒸馏通过温度缩放软化教师模型的softmax输出,使低概率类别信息得以传递给学生模型
模型蒸馏可在保持80%-90%代码生成质量的同时将推理成本降低一个数量级
厂商推出的mini或lite版本模型通常是蒸馏技术的产物,可将推理成本降低一个数量级
Knowledge Distillation is a technique for transferring knowledge from a large teacher model to a smaller student model, proposed by Geoffrey Hinton et al. in 2015
模型蒸馏技术由Geoffrey Hinton团队于2015年提出,最初用于模型压缩,通过让学生模型拟合教师模型的软标签输出
知识蒸馏的核心思想是让学生模型模仿教师模型输出的软标签(各类别概率分布),软标签被Hinton称为暗知识(dark knowledge)
可利用大模型(如GPT-4)基于领域文档自动生成合成训练数据,降低标注成本
Gemini Flash系列采用知识蒸馏(Knowledge Distillation)、模型量化(Quantization)以及架构裁剪等技术手段来压缩参数规模与计算开销
全部知识事实 (9)
Knowledge Distillation is a technique for transferring knowledge from a large teacher model to a smaller student model, proposed by Geoffrey Hinton et al. in 2015
70%已验证模型蒸馏技术由Geoffrey Hinton团队于2015年提出,最初用于模型压缩,通过让学生模型拟合教师模型的软标签输出
65%已验证知识蒸馏的核心思想是让学生模型模仿教师模型输出的软标签(各类别概率分布),软标签被Hinton称为暗知识(dark knowledge)
65%待验证Gemini Flash系列采用知识蒸馏(Knowledge Distillation)、模型量化(Quantization)以及架构裁剪等技术手段来压缩参数规模与计算开销
70%待验证降低大模型转写延迟的优化手段包括模型蒸馏、推测解码、KV-cache 优化、硬件加速(如 TPU v5e)及流式 chunked attention
50%待验证模型蒸馏通过温度缩放软化教师模型的softmax输出,使低概率类别信息得以传递给学生模型
50%待验证模型蒸馏可在保持80%-90%代码生成质量的同时将推理成本降低一个数量级
50%待验证厂商推出的mini或lite版本模型通常是蒸馏技术的产物,可将推理成本降低一个数量级
50%待验证可利用大模型(如GPT-4)基于领域文档自动生成合成训练数据,降低标注成本
50%