CPUvsLPU
硬件与电子工程领域术语对比 — 快速理解两者的核心差异
概览对比
CPU
CPU 是计算机中执行指令和处理数据的核心芯片,由少量高性能核心组成(通常 4-128 核),擅长复杂的分支逻辑、顺序计算和操作系统调度。在 AI 时代,CPU 仍然负责数据预处理、模型加载和系统协调,但矩阵乘法等并行密集型任务已交给 GPU、TPU 等专用加速器。
LPU
LPU 是 Groq 从零设计的 ASIC,专门针对大语言模型推理中的自回归生成(逐 token 生成)优化。与 GPU 的通用并行计算不同,LPU 消除了传统处理器中的所有非确定性来源(缓存层级、中断、动态调度),让编译器能静态规划每条指令的执行和数据流向,实现极致的推理延迟。2025 年底 NVIDIA 与 Groq 签署了非独占技术授权协议。
核心要点
CPU
- 少量高性能核心(4-128 核),擅长复杂逻辑和低延迟顺序任务
- 通用性最强——能运行任何程序,但在大规模并行计算上效率远低于 GPU/TPU
- AI 工作流中仍不可或缺:数据预处理、模型编排、系统调度都依赖 CPU
LPU
- 确定性架构——消除缓存、中断、动态调度等非确定性,编译器静态规划全部执行
- LLM 推理延迟碾压 GPU,能效比高达 10 倍
- 2025 年底 NVIDIA 与 Groq 签署非独占技术授权协议,验证了 LPU 架构的价值
正式定义
CPU
计算机系统中执行通用指令和协调各组件工作的核心处理器,由少量高性能核心组成。
LPU
Groq 自研的专用集成电路,基于确定性张量流处理器(TSP)架构,专为大语言模型推理的自回归生成阶段优化。
应用场景
CPU
- 操作系统调度、进程管理和 I/O 处理
- AI 工作流中的数据预处理、模型加载和推理编排
- 复杂分支逻辑密集的业务应用(数据库、编译器、Web 服务器)
LPU
- 超低延迟 LLM 推理服务(聊天机器人、代码补全等实时场景)
- 对推理延迟敏感的 AI Agent 工作流
- 需要高能效比的边缘推理部署
详细解读
CPU
CPU 采用复杂的流水线、分支预测、乱序执行和多级缓存设计,目标是让单个线程尽可能快地执行。Intel 和 AMD 的最新服务器 CPU 已达 128 核以上,但与 GPU 的数千个核心相比仍属「少而精」。在 AI 推理中,CPU 适合小模型和低吞吐场景;在训练中,CPU 主要负责数据加载和梯度同步等辅助任务。随着 NPU 被集成到消费级 CPU 中(如 Intel Meteor Lake、Apple M4),CPU 正在从「纯通用处理器」向「CPU+NPU 异构芯片」演进。
LPU
LPU 的核心是 TSP(Tensor Streaming Processor),一种完全确定性的处理器芯片。传统 CPU/GPU 依赖缓存层级、分支预测和动态调度来提升性能,但这些机制引入了不可预测性,编译器无法精确控制执行时序。LPU 反其道而行:没有缓存层级(用大容量 SRAM 替代)、没有中断、没有动态调度,所有指令的执行时间在编译期就完全确定。多颗 TSP 通过确定性网络互联组成推理集群,数据流在芯片间的传输同样可预测。这种架构特别适合 LLM 的自回归推理——每个 token 的生成是顺序的、可预测的,正好匹配 LPU 的确定性执行模型。Groq 3 LPU 进一步优化了 decode 阶段的性能。
快速对比
| 维度 | CPU | LPU |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 芯片 | 芯片 |
| 热度 | 70 | 75 |