CSAvsHCA
AI领域术语对比 — 快速理解两者的核心差异
CSA
Compressed Sparse Attention
压缩稀疏注意力 · 先压缩再挑选的长上下文方案
HCA
Heavily Compressed Attention
重度压缩注意力 · 极致压缩换来的全局视野
概览对比
CSA
CSA 是 DeepSeek V4 引入的混合注意力架构的一半。它用两步解决长上下文的算力和显存瓶颈:第一步把每 4 个 token 的 KV 条目压缩成 1 个(KV 缓存缩小 4 倍),第二步用一个 FP4 精度的闪电索引器给压缩块打分,只挑 top-k 最相关的块做注意力计算。大部分上下文被直接跳过。
HCA
HCA 是 DeepSeek V4 混合注意力架构的另一半,与 CSA 互补。它的策略是「极致压缩 + 全量注意力」:把每 128 个 token 压缩成 1 个 KV 条目,百万 token 变成不到 8000 个压缩块,然后对所有压缩块做密集注意力——因为序列已经足够短,全量计算反而很便宜。
核心要点
CSA
- 两步降本:先 4 倍压缩 KV 缓存,再 top-k 稀疏选择——大部分上下文被跳过
- 闪电索引器用 FP4 精度运行,配合 FP4 量化感知训练保持 99.7% 的 KV 条目召回率
- 与 HCA 交替排列在不同层中,CSA 负责细粒度选择,HCA 负责全局覆盖
HCA
- 128 倍压缩——百万 token 变成约 7800 个压缩块,KV 缓存极小
- 压缩后做全量密集注意力,不需要稀疏选择——保证全局信息不遗漏
- 与 CSA 交替排列:CSA 做细粒度挑选,HCA 做全局覆盖,互补长短
正式定义
CSA
DeepSeek V4 提出的注意力机制,通过 KV 缓存压缩和稀疏 top-k 选择实现长上下文的高效推理。
HCA
DeepSeek V4 提出的注意力机制,通过 128 倍 KV 缓存压缩将序列缩短到可直接做密集注意力的长度,实现全局覆盖。
应用场景
CSA
- 百万 token 上下文的 Agent 工作流——长工具调用链、多轮对话不再因 KV 缓存爆显存
- 长文档分析和代码仓库级理解——CSA 的稀疏选择自动聚焦最相关的上下文片段
- 推理成本敏感的部署场景——CSA 大幅降低每 token 的 FLOPs 和显存占用
HCA
- 需要全局语义理解的长文档任务——HCA 不做稀疏选择,确保不遗漏远距离依赖
- 与 CSA 配合用于 Agent 长链推理——HCA 层维持全局上下文感知,CSA 层精准定位
- 显存极度受限的部署场景——128 倍压缩使 KV 缓存占用降到极低水平
详细解读
CSA
在标准 Transformer 中,注意力的计算量和 KV 缓存都随序列长度线性增长,百万 token 上下文意味着万亿级比较。CSA 的解决思路是「压缩 + 稀疏」双管齐下:首先通过学习的 softmax 门控池化将每 m=4 个连续 token 的 KV 条目合并为一个压缩条目;然后用闪电索引器(FP4 精度的多头点积 + ReLU 打分)对压缩块评分,只选出 top-k 个最相关的块参与注意力计算。同时保留一个 128 token 的滑动窗口分支,确保最近的 token 不被压缩丢失细节。DeepSeek V4-Pro 在 61 层中交替使用 CSA 和 HCA,使百万 token 上下文的 KV 缓存降至 V3 的 10%,单 token 推理 FLOPs 降至 27%。
HCA
HCA 的设计哲学与 CSA 相反:CSA 是「轻压缩 + 稀疏选择」,HCA 是「重压缩 + 密集注意力」。HCA 使用 m'=128 的压缩比,将每 128 个连续 token 的 KV 条目合并为一个。百万 token 的序列被压缩到约 7800 个块,此时对全部块做密集注意力的计算量已经很低,无需再做 top-k 选择。同样保留 128 token 的滑动窗口分支处理最近上下文。在 DeepSeek V4-Pro 的 61 层架构中,前 2 层使用 HCA,之后 CSA 和 HCA 交替排列。这种混合设计让不同层以不同粒度处理长上下文:CSA 层精准定位关键信息,HCA 层维持全局语义覆盖。两者配合使 V4 在百万 token 下实现了 KV 缓存仅为 GQA-8 方案 2% 的极致效率。
快速对比
| 维度 | CSA | HCA |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | LLM、模型推理 | LLM、模型推理 |
| 热度 | 82 | 82 |