GGML
Georgi Gerganov 的 C 张量库 · llama.cpp 与本地推理革命的起点
- 定义
- GGML是AI领域的专业术语。GGML 是 Georgi Gerganov 于 2022 年底开发的纯 C 机器学习张量库,名字取自作者姓名首字母(GG)+ Machine Learning。
最后更新:2026-03-29
什么是GGML?
GGML 是 Georgi Gerganov 于 2022 年底开发的纯 C 机器学习张量库,名字取自作者姓名首字母(GG)+ Machine Learning。它以极简的内存管理和高效的 CPU 推理为设计目标,直接催生了 llama.cpp 项目,开启了「消费级硬件跑大模型」的浪潮。
- 纯 C 实现,无 Python/PyTorch 依赖,极致轻量
- 同时也定义了一种同名二进制模型格式(已于 2023 年 8 月被 GGUF 取代)
- 催生了 llama.cpp 生态,Georgi Gerganov 随后创立 ggml.ai 公司获 Nat Friedman 投资
GGML详解
Gerganov 受 Fabrice Bellard 的 LibNC 启发,从零构建了 GGML 库,核心特性包括:严格的手动内存管理(无隐式分配)、多线程张量运算、以及对量化张量的原生支持。GGML 既是一个计算库(类似轻量版 PyTorch),也曾定义了一种模型分发的二进制格式。但旧格式缺乏版本控制和元数据扩展能力,2023 年 8 月被 GGUF 格式正式取代,llama.cpp 随即停止对 GGML 格式文件的支持。作为计算库,GGML 仍在活跃开发中,是 llama.cpp、whisper.cpp 等项目的底层引擎。2023 年 Gerganov 成立 ggml.ai 公司,由 Nat Friedman 和 Daniel Gross 提供种子资金。
公式提示
GG = Georgi Gerganov,ML = Machine Learning;注意区分:GGML 库(仍活跃)≠ GGML 格式(已废弃)
GGML的应用场景
正式定义
由 Georgi Gerganov 开发的纯 C 张量运算库,为 CPU 和消费级硬件上的高效机器学习推理而设计。
应用场景
- 作为 llama.cpp / whisper.cpp 等本地推理项目的底层计算引擎
- 在嵌入式设备或无 GPU 环境中运行量化模型
常见误区
- GGML 格式已废弃,但 GGML 库本身仍在活跃维护——两者要区分
- GGML 不只能跑 LLaMA——它是通用张量库,也支持 Whisper 语音模型等非文本任务
实际案例
📌 llama.cpp 的诞生
2023 年 3 月 Gerganov 基于 GGML 库实现了 LLaMA 模型的纯 C/C++ 推理,单个 MacBook 即可运行 7B 参数模型,引爆了开源本地推理社区。
GGML的参考来源
关于GGML的常见问题
- GGML 和 GGUF 是什么关系
- GGML 既是一个 C 张量计算库,也曾定义了一种模型文件格式。2023 年 8 月该文件格式被 GGUF 取代,但 GGML 库本身仍是 llama.cpp 的底层引擎。
- GGML 格式的模型还能用吗
- 主流工具已不再支持。llama.cpp 自 2023 年 8 月起停止加载 GGML 格式文件,需转换为 GGUF 才能使用。
- GG 是什么意思
- 是作者 Georgi Gerganov 名字的首字母缩写,不是「Good Game」。