硬件与电子工程专业术语
LPU
Language Processing Unit
语言处理器 · 为 LLM 推理而生的确定性芯片
芯片
LPU
- 定义
- LPU(Language Processing Unit)是硬件与电子工程领域的专业术语。LPU 是 Groq 从零设计的 ASIC,专门针对大语言模型推理中的自回归生成(逐 token 生成)优化。
最后更新:2026-04-29
什么是LPU?
LPU 是 Groq 从零设计的 ASIC,专门针对大语言模型推理中的自回归生成(逐 token 生成)优化。与 GPU 的通用并行计算不同,LPU 消除了传统处理器中的所有非确定性来源(缓存层级、中断、动态调度),让编译器能静态规划每条指令的执行和数据流向,实现极致的推理延迟。2025 年底 NVIDIA 与 Groq 签署了非独占技术授权协议。
- 确定性架构——消除缓存、中断、动态调度等非确定性,编译器静态规划全部执行
- LLM 推理延迟碾压 GPU,能效比高达 10 倍
- 2025 年底 NVIDIA 与 Groq 签署非独占技术授权协议,验证了 LPU 架构的价值
LPU详解
LPU 的核心是 TSP(Tensor Streaming Processor),一种完全确定性的处理器芯片。传统 CPU/GPU 依赖缓存层级、分支预测和动态调度来提升性能,但这些机制引入了不可预测性,编译器无法精确控制执行时序。LPU 反其道而行:没有缓存层级(用大容量 SRAM 替代)、没有中断、没有动态调度,所有指令的执行时间在编译期就完全确定。多颗 TSP 通过确定性网络互联组成推理集群,数据流在芯片间的传输同样可预测。这种架构特别适合 LLM 的自回归推理——每个 token 的生成是顺序的、可预测的,正好匹配 LPU 的确定性执行模型。Groq 3 LPU 进一步优化了 decode 阶段的性能。
LPU的应用场景
正式定义
Groq 自研的专用集成电路,基于确定性张量流处理器(TSP)架构,专为大语言模型推理的自回归生成阶段优化。
应用场景
- 超低延迟 LLM 推理服务(聊天机器人、代码补全等实时场景)
- 对推理延迟敏感的 AI Agent 工作流
- 需要高能效比的边缘推理部署
常见误区
- LPU 不能做 AI 训练——它只针对推理优化,训练仍需 GPU/TPU
- LPU 不是「更快的 GPU」——它是完全不同的架构,通过消除非确定性而非增加并行度来提速
实际案例
📌 Groq 的推理速度演示
Groq 在 2024 年初公开演示了 LPU 运行 Llama 2 70B 的推理速度,token 生成速率远超同期 GPU 方案,引发行业关注。其核心优势不是算力更大,而是确定性执行消除了 GPU 推理中的调度开销和显存带宽瓶颈。
LPU的参考来源
关于LPU的常见问题
- LPU 和 GPU 有什么区别
- GPU 是通用并行计算器,靠大量核心做并行矩阵运算;LPU 是确定性推理专用芯片,靠消除硬件非确定性让编译器精确控制执行。GPU 能做训练+推理,LPU 只做推理但延迟和能效远优于 GPU。
- LPU 会取代 GPU 吗
- 短期不会。LPU 只能做推理不能做训练,且生态远不如 CUDA 成熟。但在 LLM 推理这个细分场景上,LPU 的延迟和能效优势明显。NVIDIA 与 Groq 签署技术授权说明两者更可能互补而非替代。