LELexEdge词汇锋面
AI专业术语

GGMLvsGGUF

AI领域术语对比 — 快速理解两者的核心差异

概览对比

GGML

GGML 是 Georgi Gerganov 于 2022 年底开发的纯 C 机器学习张量库,名字取自作者姓名首字母(GG)+ Machine Learning。它以极简的内存管理和高效的 CPU 推理为设计目标,直接催生了 llama.cpp 项目,开启了「消费级硬件跑大模型」的浪潮。

GGUF

GGUF 是 llama.cpp 团队于 2023 年 8 月推出的二进制模型文件格式,取代了旧版 GGML。它将模型权重、分词器、架构配置和元数据打包进单个文件,配合量化技术可以把数十 GB 的大模型压缩到几 GB,让普通笔记本和手机也能跑 LLM 推理。

核心要点

GGML

  • 纯 C 实现,无 Python/PyTorch 依赖,极致轻量
  • 同时也定义了一种同名二进制模型格式(已于 2023 年 8 月被 GGUF 取代)
  • 催生了 llama.cpp 生态,Georgi Gerganov 随后创立 ggml.ai 公司获 Nat Friedman 投资

GGUF

  • 单文件封装权重 + 分词器 + 配置 + 元数据,部署只需拷贝一个文件
  • 支持 Q2 到 Q8 多级量化,在模型体积和推理质量之间灵活取舍
  • 已成为 Ollama、llama.cpp、LM Studio 等本地推理工具链的事实标准

正式定义

GGML

由 Georgi Gerganov 开发的纯 C 张量运算库,为 CPU 和消费级硬件上的高效机器学习推理而设计。

GGUF

由 llama.cpp 项目定义的二进制模型文件格式,用于高效存储和推理量化后的大语言模型。

应用场景

GGML

  • 作为 llama.cpp / whisper.cpp 等本地推理项目的底层计算引擎
  • 在嵌入式设备或无 GPU 环境中运行量化模型

GGUF

  • 在消费级硬件上本地运行 LLM(笔记本、台式机、手机)
  • 通过不同量化级别平衡模型质量与硬件资源
  • Hugging Face 模型分发与社区共享

详细解读

GGML

Gerganov 受 Fabrice Bellard 的 LibNC 启发,从零构建了 GGML 库,核心特性包括:严格的手动内存管理(无隐式分配)、多线程张量运算、以及对量化张量的原生支持。GGML 既是一个计算库(类似轻量版 PyTorch),也曾定义了一种模型分发的二进制格式。但旧格式缺乏版本控制和元数据扩展能力,2023 年 8 月被 GGUF 格式正式取代,llama.cpp 随即停止对 GGML 格式文件的支持。作为计算库,GGML 仍在活跃开发中,是 llama.cpp、whisper.cpp 等项目的底层引擎。2023 年 Gerganov 成立 ggml.ai 公司,由 Nat Friedman 和 Daniel Gross 提供种子资金。

GGUF

GGUF 由 Georgi Gerganov(llama.cpp 作者,GG 即其名字缩写)设计,解决了前代 GGML 格式的扩展性和兼容性问题。核心优势在于:自描述的键值元数据结构使不同模型架构可以共用同一格式;支持 mmap 内存映射实现快速加载;量化方案从 Q2_K(极限压缩)到 Q8_0(接近全精度)覆盖多种场景。Hugging Face 上大量模型同时提供 GGUF 量化版本,TheBloke 等社区贡献者持续为新模型制作 GGUF 变体。2025 年 llama.cpp 引入 Q4_K_4 和 Q8R16 等新量化方法,推理速度再提升 1.5-2 倍。GGUF 的普及使「本地跑大模型」从极客玩具变成了主流选项。

快速对比

维度GGMLGGUF
类型专业术语专业术语
标签LLM、模型推理、机器学习LLM、模型推理、模型训练
热度5582

共同关联术语

llama.cpp量化