AI专业术语
Quantization
量化 · 用精度换速度,让大模型跑在小显卡上
模型推理模型训练
QUAN
- 定义
- Quantization是AI领域的专业术语。Quantization 将模型参数从 32 位浮点数压缩到 8 位甚至 4 位整数,内存占用减少 4-8 倍,推理速度提升 2-4 倍,精度损失通常可接受。
最后更新:2026-03-18
什么是Quantization?
Quantization 将模型参数从 32 位浮点数压缩到 8 位甚至 4 位整数,内存占用减少 4-8 倍,推理速度提升 2-4 倍,精度损失通常可接受。这让 70B 参数的模型也能在消费级 GPU 上运行。
- FP16→INT8 量化几乎无损,INT4 有轻微损失
- GPTQ 和 AWQ 是最流行的量化方法
- 量化让本地部署大模型成为可能
Quantization详解
Quantization 是模型压缩的核心技术,通过降低数值精度来减少模型的内存占用和计算量。主流方法包括训练后量化(PTQ)和量化感知训练(QAT)。GPTQ、AWQ、GGUF 等格式已成为开源社区的标准。量化的核心权衡是精度损失 vs 效率提升——4-bit 量化通常能保留 95% 以上的模型能力,但在需要精确推理的任务上可能出现明显退化。
Quantization的应用场景
正式定义
通过降低模型参数的数值精度来减少内存占用和加速推理的模型压缩技术
应用场景
- 在消费级 GPU 上运行大模型
- 降低云端推理的硬件成本
- 移动端和边缘设备的模型部署
常见误区
- 量化不是简单的四舍五入,需要专门的算法保持精度
- 量化后的模型不一定更快,还取决于硬件对低精度计算的支持
- 不是所有层都适合量化,关键层需要保持高精度
实际案例
📌 LLaMA-70B 的本地部署
通过 4-bit GPTQ 量化,LLaMA-70B 的显存需求从 140GB 降到 35GB,可以在单张 A100 或两张 RTX 4090 上运行,推理速度约 20 tokens/s。
Quantization的参考来源
关于Quantization的常见问题
- 量化会影响模型效果吗
- 轻度量化(如 8-bit)几乎无损,4-bit 量化会有轻微精度下降但大幅降低显存需求,通常是可接受的权衡。
- 常见的量化方法有哪些
- 主流方法包括 GPTQ、AWQ、GGUF、bitsandbytes,各有不同的精度-速度权衡。