[KongchangAI]
ConceptQuantized LoRA

QLoRA

QLoRA(Quantized Low-Rank Adaptation)是一种参数高效的大语言模型微调方法,结合了模型量化技术与低秩适配(LoRA)策略。其核心机制是将预训练模型权重量化为低精度格式(如4-bit)以大幅降低显存占用,同时仅训练少量可学习的低秩适配参数,从而在保持模型性能接近全量微调水平的前提下,显著降低对计算资源的需求,使大规模语言模型的微调在有限硬件条件下成为可能。

Core Facts

Timeline (last 90 days)

Jun 2

LoRA和QLoRA是当前主流的参数高效微调方法,允许在消费级GPU上完成微调

Verified70%
Jun 1

QLoRA由华盛顿大学的研究团队在2023年提出,将基础模型权重量化为4-bit(NF4格式)

Verified80%
Jun 1

Unsloth支持QLoRA等量化微调方案,让16GB显存的显卡也能进行模型微调

Unverified60%
Jun 1

QLoRA由华盛顿大学的Tim Dettmers等人于2023年提出

Verified65%
Jun 1

使用QLoRA在RTX 4090上微调Llama 7B模型,显存占用约5-8GB

Unverified75%
Jun 1

QLoRA技术可将7B参数模型的显存占用从约28GB降低到不足6GB

Unverified80%
Jun 1

PEFT库支持LoRA和QLoRA等参数高效微调方法,可将需要更新的参数量从数十亿降低到数百万级别

Unverified90%
Jun 1

QLoRA结合4-bit量化,使得在消费级GPU上微调70B参数模型成为可能

Unverified90%
Jun 1

QLoRA将基础模型量化为4位精度存储,同时在量化后的模型上应用LoRA适配器进行训练

Unverified70%
Jun 1

QLoRA(Quantized Low-Rank Adaptation)是2023年由华盛顿大学提出的技术

Unverified90%

9 more timeline events

Source Articles