AI专业术语
VRAM
Video Random Access Memory
显存 · AI 时代最贵的「房间大小」
模型推理机器学习
VRAM
- 定义
- VRAM(Video Random Access Memory)是AI领域的专业术语。VRAM 是 GPU 上的高速内存,直接决定了能加载多大的模型。
最后更新:2026-03-18
什么是VRAM?
VRAM 是 GPU 上的高速内存,直接决定了能加载多大的模型。一个 70B 参数的模型需要约 140GB VRAM(FP16),而顶级消费级显卡 RTX 4090 只有 24GB——这就是为什么量化技术如此重要。
- VRAM 大小直接限制可运行的模型规模
- FP16 下每 10 亿参数约需 2GB VRAM
- VRAM 不够时可以用 CPU 内存补充但速度大幅下降
VRAM详解
VRAM 是 AI 基础设施中最关键的瓶颈资源。模型参数、KV Cache、激活值都需要存储在 VRAM 中。随着模型规模增长,VRAM 需求呈线性甚至超线性增长。当前解决 VRAM 瓶颈的方法包括:模型量化、张量并行(多卡分摊)、offloading(部分数据放 CPU 内存)、以及 FlashAttention 等内存优化算法。NVIDIA H100 的 80GB VRAM 已成为 AI 训练的标准配置。
公式提示
FP16: 参数量(B) × 2 = 所需 VRAM(GB);INT4: 参数量(B) × 0.5 ≈ 所需 VRAM(GB)
VRAM的应用场景
正式定义
图形处理器上的专用高速内存,用于存储模型参数和计算中间结果
应用场景
- 评估本地部署模型的硬件需求
- 选择合适的 GPU 配置
- 优化模型以适应 VRAM 限制
常见误区
- VRAM 不等于系统内存(RAM),两者不能直接互换
- VRAM 大不代表推理快,带宽和计算核心同样重要
- 多张小显存 GPU 不等于一张大显存 GPU,通信开销不可忽视
实际案例
📌 VRAM 需求速算
FP16 精度下:7B 模型 ≈ 14GB VRAM,13B ≈ 26GB,70B ≈ 140GB。4-bit 量化后分别降至约 4GB、7GB、35GB。
VRAM的参考来源
- 文档
- 社区Which GPU for Deep LearningTim Dettmers · 2023-01
关于VRAM的常见问题
- 跑 LLM 需要多少显存
- 粗略估算:模型参数量(B) × 2 = FP16 所需显存(GB)。7B 模型约需 14GB,70B 模型约需 140GB。
- 显存不够怎么办
- 可以用量化(4-bit/8-bit)、模型并行、offloading 到内存/硬盘,或选择更小的模型。