GGMLvsGGUF
AI领域术语对比 — 快速理解两者的核心差异
GGML
Georgi Gerganov 的 C 张量库 · llama.cpp 与本地推理革命的起点
GGUF
GPT-Generated Unified Format
本地大模型推理的事实标准格式 · 一个文件装下整个模型
概览对比
GGML
GGML 是 Georgi Gerganov 于 2022 年底开发的纯 C 机器学习张量库,名字取自作者姓名首字母(GG)+ Machine Learning。它以极简的内存管理和高效的 CPU 推理为设计目标,直接催生了 llama.cpp 项目,开启了「消费级硬件跑大模型」的浪潮。
GGUF
GGUF 是 llama.cpp 团队于 2023 年 8 月推出的二进制模型文件格式,取代了旧版 GGML。它将模型权重、分词器、架构配置和元数据打包进单个文件,配合量化技术可以把数十 GB 的大模型压缩到几 GB,让普通笔记本和手机也能跑 LLM 推理。
核心要点
GGML
- 纯 C 实现,无 Python/PyTorch 依赖,极致轻量
- 同时也定义了一种同名二进制模型格式(已于 2023 年 8 月被 GGUF 取代)
- 催生了 llama.cpp 生态,Georgi Gerganov 随后创立 ggml.ai 公司获 Nat Friedman 投资
GGUF
- 单文件封装权重 + 分词器 + 配置 + 元数据,部署只需拷贝一个文件
- 支持 Q2 到 Q8 多级量化,在模型体积和推理质量之间灵活取舍
- 已成为 Ollama、llama.cpp、LM Studio 等本地推理工具链的事实标准
正式定义
GGML
由 Georgi Gerganov 开发的纯 C 张量运算库,为 CPU 和消费级硬件上的高效机器学习推理而设计。
GGUF
由 llama.cpp 项目定义的二进制模型文件格式,用于高效存储和推理量化后的大语言模型。
应用场景
GGML
- 作为 llama.cpp / whisper.cpp 等本地推理项目的底层计算引擎
- 在嵌入式设备或无 GPU 环境中运行量化模型
GGUF
- 在消费级硬件上本地运行 LLM(笔记本、台式机、手机)
- 通过不同量化级别平衡模型质量与硬件资源
- Hugging Face 模型分发与社区共享
详细解读
GGML
Gerganov 受 Fabrice Bellard 的 LibNC 启发,从零构建了 GGML 库,核心特性包括:严格的手动内存管理(无隐式分配)、多线程张量运算、以及对量化张量的原生支持。GGML 既是一个计算库(类似轻量版 PyTorch),也曾定义了一种模型分发的二进制格式。但旧格式缺乏版本控制和元数据扩展能力,2023 年 8 月被 GGUF 格式正式取代,llama.cpp 随即停止对 GGML 格式文件的支持。作为计算库,GGML 仍在活跃开发中,是 llama.cpp、whisper.cpp 等项目的底层引擎。2023 年 Gerganov 成立 ggml.ai 公司,由 Nat Friedman 和 Daniel Gross 提供种子资金。
GGUF
GGUF 由 Georgi Gerganov(llama.cpp 作者,GG 即其名字缩写)设计,解决了前代 GGML 格式的扩展性和兼容性问题。核心优势在于:自描述的键值元数据结构使不同模型架构可以共用同一格式;支持 mmap 内存映射实现快速加载;量化方案从 Q2_K(极限压缩)到 Q8_0(接近全精度)覆盖多种场景。Hugging Face 上大量模型同时提供 GGUF 量化版本,TheBloke 等社区贡献者持续为新模型制作 GGUF 变体。2025 年 llama.cpp 引入 Q4_K_4 和 Q8R16 等新量化方法,推理速度再提升 1.5-2 倍。GGUF 的普及使「本地跑大模型」从极客玩具变成了主流选项。
快速对比
| 维度 | GGML | GGUF |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | LLM、模型推理、机器学习 | LLM、模型推理、模型训练 |
| 热度 | 55 | 82 |