AI专业术语
QLoRA
Quantized Low-Rank Adaptation
量化 + 低秩适配 · 单卡微调百亿参数模型
模型训练LLMPEFT
QLOR
- 定义
- QLoRA(Quantized Low-Rank Adaptation)是AI领域的专业术语。QLoRA 把预训练模型量化为 4-bit NormalFloat 精度存储,同时在冻结的量化权重上附加全精度的 LoRA 适配器进行训练。
最后更新:2026-03-29
什么是QLoRA?
QLoRA 把预训练模型量化为 4-bit NormalFloat 精度存储,同时在冻结的量化权重上附加全精度的 LoRA 适配器进行训练。原本需要多卡并行才能微调的 65B 模型,现在一张 48GB GPU 就能搞定,且任务性能几乎不掉。
- 引入 NF4 数据类型,比标准 4-bit 量化精度更高
- 双重量化技术进一步压缩量化常数的显存占用
- 在 Guanaco 基准上,QLoRA 微调的 65B 模型达到 ChatGPT 99.3% 的性能
QLoRA详解
QLoRA 由华盛顿大学团队于 2023 年提出,核心创新有三点:一是 4-bit NormalFloat(NF4)量化,针对正态分布的预训练权重做信息论最优量化;二是双重量化(Double Quantization),对量化常数本身再做一次 8-bit 量化,每个参数额外节省约 0.37 bit;三是分页优化器,利用 NVIDIA 统一内存在 GPU 显存不足时自动卸载到 CPU。反向传播时梯度通过冻结的 4-bit 权重计算,但只更新全精度的 LoRA 参数。这使得个人开发者和小团队也能在单卡上微调最大规模的开源模型。
公式提示
显存 ≈ 模型参数量 × 0.5 字节(4-bit)+ LoRA 参数 × 2 字节(16-bit)
QLoRA的应用场景
正式定义
一种将 4-bit 模型量化与低秩适配器训练相结合的参数高效微调框架,在大幅降低显存需求的同时保持全精度微调的任务性能。
应用场景
- 在单张消费级 GPU 上微调 70B 级别开源模型
- 资源受限团队快速验证大模型在垂直领域的效果
- 边缘设备上的模型适配与部署前微调
常见误区
- QLoRA 不是简单地把 LoRA 和量化拼在一起——它引入了专门的 NF4 数据类型和双重量化
- 4-bit 量化不意味着精度大幅下降,NF4 针对预训练权重分布做了优化
实际案例
📌 单卡微调 LLaMA-65B
在单张 A100 48GB 上用 QLoRA 微调 LLaMA-65B,训练 Guanaco 对话数据集 24 小时,最终模型在 Vicuna 基准上达到 ChatGPT 99.3% 的评分。
QLoRA的参考来源
- 论文QLoRA: Efficient Finetuning of Quantized LLMsTim Dettmers et al. · 2023-05
- 社区
关于QLoRA的常见问题
- QLoRA 和 LoRA 有什么区别
- QLoRA 在 LoRA 基础上先将模型量化到 4-bit 再做低秩适配,显存占用进一步降低约 50%,可在单张消费级 GPU 上微调 65B 模型。
- QLoRA 量化会损失精度吗
- 会有轻微损失,但 QLoRA 引入的 NF4 量化和双重量化技术将精度损失控制在可接受范围,实测效果与 16-bit LoRA 接近。