CSA
Compressed Sparse Attention
压缩稀疏注意力 · 先压缩再挑选的长上下文方案
- 定义
- CSA(Compressed Sparse Attention)是AI领域的专业术语。CSA 是 DeepSeek V4 引入的混合注意力架构的一半。
最后更新:2026-04-29
什么是CSA?
CSA 是 DeepSeek V4 引入的混合注意力架构的一半。它用两步解决长上下文的算力和显存瓶颈:第一步把每 4 个 token 的 KV 条目压缩成 1 个(KV 缓存缩小 4 倍),第二步用一个 FP4 精度的闪电索引器给压缩块打分,只挑 top-k 最相关的块做注意力计算。大部分上下文被直接跳过。
- 两步降本:先 4 倍压缩 KV 缓存,再 top-k 稀疏选择——大部分上下文被跳过
- 闪电索引器用 FP4 精度运行,配合 FP4 量化感知训练保持 99.7% 的 KV 条目召回率
- 与 HCA 交替排列在不同层中,CSA 负责细粒度选择,HCA 负责全局覆盖
CSA详解
在标准 Transformer 中,注意力的计算量和 KV 缓存都随序列长度线性增长,百万 token 上下文意味着万亿级比较。CSA 的解决思路是「压缩 + 稀疏」双管齐下:首先通过学习的 softmax 门控池化将每 m=4 个连续 token 的 KV 条目合并为一个压缩条目;然后用闪电索引器(FP4 精度的多头点积 + ReLU 打分)对压缩块评分,只选出 top-k 个最相关的块参与注意力计算。同时保留一个 128 token 的滑动窗口分支,确保最近的 token 不被压缩丢失细节。DeepSeek V4-Pro 在 61 层中交替使用 CSA 和 HCA,使百万 token 上下文的 KV 缓存降至 V3 的 10%,单 token 推理 FLOPs 降至 27%。
公式提示
CSA 流程:原始序列 → 每 4 token 压缩为 1 块 → 闪电索引器 top-k 选择 → 仅对选中块做注意力
CSA的应用场景
正式定义
DeepSeek V4 提出的注意力机制,通过 KV 缓存压缩和稀疏 top-k 选择实现长上下文的高效推理。
应用场景
- 百万 token 上下文的 Agent 工作流——长工具调用链、多轮对话不再因 KV 缓存爆显存
- 长文档分析和代码仓库级理解——CSA 的稀疏选择自动聚焦最相关的上下文片段
- 推理成本敏感的部署场景——CSA 大幅降低每 token 的 FLOPs 和显存占用
常见误区
- CSA 不是简单的截断上下文——它通过压缩保留了全部信息,只是选择性地关注最相关的部分
- CSA 单独使用效果有限——它需要与 HCA 交替配合,CSA 做细粒度选择,HCA 做全局覆盖
实际案例
📌 DeepSeek V4 百万 token 效率
在百万 token 上下文下,DeepSeek V4-Pro 通过 CSA+HCA 混合注意力将 KV 缓存降至 V3 的 10%、单 token FLOPs 降至 27%。与 GQA-8 头 BF16 方案相比,KV 缓存仅为其 2%。
CSA的参考来源
关于CSA的常见问题
- CSA 和标准注意力有什么区别
- 标准注意力对所有 token 做全量计算,CSA 先把 KV 缓存压缩 4 倍,再只挑最相关的块计算。大部分上下文被跳过,算力和显存都大幅降低。
- CSA 和 HCA 怎么配合
- CSA 压缩 4 倍后稀疏选择(细粒度),HCA 压缩 128 倍后全量注意力(全局覆盖)。两者在不同层交替排列,互补长短。