QLoRA(Quantized Low-Rank Adaptation)是一种参数高效的大语言模型微调方法,结合了模型量化技术与低秩适配(LoRA)策略。其核心机制是将预训练模型权重量化为低精度格式(如4-bit)以大幅降低显存占用,同时仅训练少量可学习的低秩适配参数,从而在保持模型性能接近全量微调水平的前提下,显著降低对计算资源的需求,使大规模语言模型的微调在有限硬件条件下成为可能。
LoRA和QLoRA是当前主流的参数高效微调方法,允许在消费级GPU上完成微调
QLoRA由华盛顿大学的研究团队在2023年提出,将基础模型权重量化为4-bit(NF4格式)
Unsloth支持QLoRA等量化微调方案,让16GB显存的显卡也能进行模型微调
QLoRA由华盛顿大学的Tim Dettmers等人于2023年提出
使用QLoRA在RTX 4090上微调Llama 7B模型,显存占用约5-8GB
QLoRA技术可将7B参数模型的显存占用从约28GB降低到不足6GB
PEFT库支持LoRA和QLoRA等参数高效微调方法,可将需要更新的参数量从数十亿降低到数百万级别
QLoRA结合4-bit量化,使得在消费级GPU上微调70B参数模型成为可能
QLoRA将基础模型量化为4位精度存储,同时在量化后的模型上应用LoRA适配器进行训练
QLoRA(Quantized Low-Rank Adaptation)是2023年由华盛顿大学提出的技术
9 more timeline events