[控场AI]
模型Distilled BERT

DistilBERT

BERT的轻量蒸馏版本,参数量约为原始BERT的40%,推理速度提升60%,常用于意图分类等NLP任务的轻量化部署

时间轴 (近 90 天)

9月11日

DistilBERT是Hugging Face团队通过知识蒸馏从BERT压缩得到的轻量模型,仅保留6层Transformer,参数量减少40%,推理速度提升60%

待验证50%
9月9日

DistilBERT将BERT-base从110M参数压缩至66M,推理速度提升60%,保留97%性能

待验证50%
9月6日

DistilBERT 的蒸馏过程使用了三重损失函数:蒸馏损失、遮蔽语言模型损失和余弦嵌入损失

待验证50%
9月6日

DistilBERT 由 Hugging Face 的 Sanh 等人于 2019 年提出,是通过知识蒸馏将 BERT-base 压缩至 6 层、6600 万参数的轻量模型

待验证50%
9月6日

DistilBERT 在保留 BERT 97% 语言理解能力的同时,将推理速度提升 60%,模型体积缩减 40%

待验证50%
9月5日

经过 DRET 增强的 DistilBERT 仅 6600 万参数,在平衡准确率、召回率、ROC-AUC 等核心指标上达到与体量大一个数量级的生物医学专用模型相当的水平

待验证50%
7月20日

DistilBERT将BERT体积压缩40%同时保留97%性能

待验证50%
7月14日

DistilBERT通过蒸馏将BERT参数量减少40%,推理速度提升60%,性能仅损失约3%

待验证50%

全部知识事实 (8)

来源文章