LELexEdge词汇锋面
AI专业术语

VRAM

Video Random Access Memory

显存 · AI 时代最贵的「房间大小」

模型推理机器学习
VRAM
定义
VRAMVideo Random Access MemoryAI领域的专业术语VRAM 是 GPU 上的高速内存,直接决定了能加载多大的模型。

最后更新:2026-03-18

什么是VRAM?

VRAM 是 GPU 上的高速内存,直接决定了能加载多大的模型。一个 70B 参数的模型需要约 140GB VRAM(FP16),而顶级消费级显卡 RTX 4090 只有 24GB——这就是为什么量化技术如此重要。

  • VRAM 大小直接限制可运行的模型规模
  • FP16 下每 10 亿参数约需 2GB VRAM
  • VRAM 不够时可以用 CPU 内存补充但速度大幅下降

VRAM详解

VRAM 是 AI 基础设施中最关键的瓶颈资源。模型参数、KV Cache、激活值都需要存储在 VRAM 中。随着模型规模增长,VRAM 需求呈线性甚至超线性增长。当前解决 VRAM 瓶颈的方法包括:模型量化、张量并行(多卡分摊)、offloading(部分数据放 CPU 内存)、以及 FlashAttention 等内存优化算法。NVIDIA H100 的 80GB VRAM 已成为 AI 训练的标准配置。

公式提示

FP16: 参数量(B) × 2 = 所需 VRAM(GB);INT4: 参数量(B) × 0.5 ≈ 所需 VRAM(GB)

VRAM的应用场景

正式定义

图形处理器上的专用高速内存,用于存储模型参数和计算中间结果

应用场景

  • 评估本地部署模型的硬件需求
  • 选择合适的 GPU 配置
  • 优化模型以适应 VRAM 限制

常见误区

  • VRAM 不等于系统内存(RAM),两者不能直接互换
  • VRAM 大不代表推理快,带宽和计算核心同样重要
  • 多张小显存 GPU 不等于一张大显存 GPU,通信开销不可忽视

实际案例

📌 VRAM 需求速算

FP16 精度下:7B 模型 ≈ 14GB VRAM,13B ≈ 26GB,70B ≈ 140GB。4-bit 量化后分别降至约 4GB、7GB、35GB。

VRAM的参考来源

关于VRAM的常见问题

跑 LLM 需要多少显存
粗略估算:模型参数量(B) × 2 = FP16 所需显存(GB)。7B 模型约需 14GB,70B 模型约需 140GB。
显存不够怎么办
可以用量化(4-bit/8-bit)、模型并行、offloading 到内存/硬盘,或选择更小的模型。

与VRAM相关的术语