PEFTvsQLoRA
AI领域术语对比 — 快速理解两者的核心差异
PEFT
Parameter-Efficient Fine-Tuning
参数高效微调 · 用 1% 的参数换 90% 的效果
QLoRA
Quantized Low-Rank Adaptation
量化 + 低秩适配 · 单卡微调百亿参数模型
概览对比
PEFT
PEFT 是一类微调策略的统称:冻结预训练模型的绝大部分参数,只训练少量新增或选定的参数来适配下游任务。Hugging Face 的 PEFT 库将 LoRA、Prefix Tuning、Prompt Tuning、IA³ 等方法统一封装,已成为开源社区微调大模型的标准工具链。
QLoRA
QLoRA 把预训练模型量化为 4-bit NormalFloat 精度存储,同时在冻结的量化权重上附加全精度的 LoRA 适配器进行训练。原本需要多卡并行才能微调的 65B 模型,现在一张 48GB GPU 就能搞定,且任务性能几乎不掉。
核心要点
PEFT
- 涵盖 LoRA、Prefix Tuning、Prompt Tuning、AdaLoRA、IA³ 等十余种方法
- Hugging Face PEFT 库与 Transformers 深度集成,几行代码即可切换微调策略
- 训练产物通常只有几十 MB 的适配器文件,便于版本管理和多任务切换
QLoRA
- 引入 NF4 数据类型,比标准 4-bit 量化精度更高
- 双重量化技术进一步压缩量化常数的显存占用
- 在 Guanaco 基准上,QLoRA 微调的 65B 模型达到 ChatGPT 99.3% 的性能
正式定义
PEFT
一类通过仅训练模型中少量额外或选定参数来实现下游任务适配的微调方法,显著降低计算和存储成本。
QLoRA
一种将 4-bit 模型量化与低秩适配器训练相结合的参数高效微调框架,在大幅降低显存需求的同时保持全精度微调的任务性能。
应用场景
PEFT
- 为同一基座模型训练多个领域适配器并按需加载
- 在有限 GPU 资源下快速迭代模型实验
- 将微调产物(适配器文件)纳入 Git 版本管理
QLoRA
- 在单张消费级 GPU 上微调 70B 级别开源模型
- 资源受限团队快速验证大模型在垂直领域的效果
- 边缘设备上的模型适配与部署前微调
详细解读
PEFT
全量微调一个 7B 模型需要存储完整的优化器状态和梯度,显存轻松超过 60GB。PEFT 方法通过不同策略绕过这个瓶颈:LoRA 注入低秩矩阵、Prefix Tuning 在注意力层前拼接可学习向量、Prompt Tuning 在输入嵌入层添加软提示、IA³ 用学习到的向量缩放激活值。Hugging Face 的 PEFT 库(GitHub 星标 17k+)将这些方法标准化,支持与 Transformers、Accelerate、bitsandbytes 无缝配合。实践中 LoRA 因效果稳定、实现简单成为默认选择,但在特定场景下 Prefix Tuning 或 IA³ 可能更优。
QLoRA
QLoRA 由华盛顿大学团队于 2023 年提出,核心创新有三点:一是 4-bit NormalFloat(NF4)量化,针对正态分布的预训练权重做信息论最优量化;二是双重量化(Double Quantization),对量化常数本身再做一次 8-bit 量化,每个参数额外节省约 0.37 bit;三是分页优化器,利用 NVIDIA 统一内存在 GPU 显存不足时自动卸载到 CPU。反向传播时梯度通过冻结的 4-bit 权重计算,但只更新全精度的 LoRA 参数。这使得个人开发者和小团队也能在单卡上微调最大规模的开源模型。
快速对比
| 维度 | PEFT | QLoRA |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM、PEFT | 模型训练、LLM、PEFT |
| 热度 | 85 | 88 |