LELexEdge词汇锋面
AI专业术语

QuantizationvsVRAM

AI领域术语对比 — 快速理解两者的核心差异

概览对比

Quantization

Quantization 将模型参数从 32 位浮点数压缩到 8 位甚至 4 位整数,内存占用减少 4-8 倍,推理速度提升 2-4 倍,精度损失通常可接受。这让 70B 参数的模型也能在消费级 GPU 上运行。

VRAM

VRAM 是 GPU 上的高速内存,直接决定了能加载多大的模型。一个 70B 参数的模型需要约 140GB VRAM(FP16),而顶级消费级显卡 RTX 4090 只有 24GB——这就是为什么量化技术如此重要。

核心要点

Quantization

  • FP16→INT8 量化几乎无损,INT4 有轻微损失
  • GPTQ 和 AWQ 是最流行的量化方法
  • 量化让本地部署大模型成为可能

VRAM

  • VRAM 大小直接限制可运行的模型规模
  • FP16 下每 10 亿参数约需 2GB VRAM
  • VRAM 不够时可以用 CPU 内存补充但速度大幅下降

正式定义

Quantization

通过降低模型参数的数值精度来减少内存占用和加速推理的模型压缩技术

VRAM

图形处理器上的专用高速内存,用于存储模型参数和计算中间结果

应用场景

Quantization

  • 在消费级 GPU 上运行大模型
  • 降低云端推理的硬件成本
  • 移动端和边缘设备的模型部署

VRAM

  • 评估本地部署模型的硬件需求
  • 选择合适的 GPU 配置
  • 优化模型以适应 VRAM 限制

详细解读

Quantization

Quantization 是模型压缩的核心技术,通过降低数值精度来减少模型的内存占用和计算量。主流方法包括训练后量化(PTQ)和量化感知训练(QAT)。GPTQ、AWQ、GGUF 等格式已成为开源社区的标准。量化的核心权衡是精度损失 vs 效率提升——4-bit 量化通常能保留 95% 以上的模型能力,但在需要精确推理的任务上可能出现明显退化。

VRAM

VRAM 是 AI 基础设施中最关键的瓶颈资源。模型参数、KV Cache、激活值都需要存储在 VRAM 中。随着模型规模增长,VRAM 需求呈线性甚至超线性增长。当前解决 VRAM 瓶颈的方法包括:模型量化、张量并行(多卡分摊)、offloading(部分数据放 CPU 内存)、以及 FlashAttention 等内存优化算法。NVIDIA H100 的 80GB VRAM 已成为 AI 训练的标准配置。

快速对比

维度QuantizationVRAM
类型专业术语专业术语
标签模型推理、模型训练模型推理、机器学习
热度7068

共同关联术语

InferenceGPU