LELexEdge词汇锋面
AI专业术语

HCA

Heavily Compressed Attention

重度压缩注意力 · 极致压缩换来的全局视野

LLM模型推理
HCA
定义
HCAHeavily Compressed AttentionAI领域的专业术语HCA 是 DeepSeek V4 混合注意力架构的另一半,与 CSA 互补。

最后更新:2026-04-29

什么是HCA?

HCA 是 DeepSeek V4 混合注意力架构的另一半,与 CSA 互补。它的策略是「极致压缩 + 全量注意力」:把每 128 个 token 压缩成 1 个 KV 条目,百万 token 变成不到 8000 个压缩块,然后对所有压缩块做密集注意力——因为序列已经足够短,全量计算反而很便宜。

  • 128 倍压缩——百万 token 变成约 7800 个压缩块,KV 缓存极小
  • 压缩后做全量密集注意力,不需要稀疏选择——保证全局信息不遗漏
  • 与 CSA 交替排列:CSA 做细粒度挑选,HCA 做全局覆盖,互补长短

HCA详解

HCA 的设计哲学与 CSA 相反:CSA 是「轻压缩 + 稀疏选择」,HCA 是「重压缩 + 密集注意力」。HCA 使用 m'=128 的压缩比,将每 128 个连续 token 的 KV 条目合并为一个。百万 token 的序列被压缩到约 7800 个块,此时对全部块做密集注意力的计算量已经很低,无需再做 top-k 选择。同样保留 128 token 的滑动窗口分支处理最近上下文。在 DeepSeek V4-Pro 的 61 层架构中,前 2 层使用 HCA,之后 CSA 和 HCA 交替排列。这种混合设计让不同层以不同粒度处理长上下文:CSA 层精准定位关键信息,HCA 层维持全局语义覆盖。两者配合使 V4 在百万 token 下实现了 KV 缓存仅为 GQA-8 方案 2% 的极致效率。

公式提示

HCA 流程:原始序列 → 每 128 token 压缩为 1 块 → 对全部压缩块做密集注意力(无需稀疏选择)

HCA的应用场景

正式定义

DeepSeek V4 提出的注意力机制,通过 128 倍 KV 缓存压缩将序列缩短到可直接做密集注意力的长度,实现全局覆盖。

应用场景

  • 需要全局语义理解的长文档任务——HCA 不做稀疏选择,确保不遗漏远距离依赖
  • 与 CSA 配合用于 Agent 长链推理——HCA 层维持全局上下文感知,CSA 层精准定位
  • 显存极度受限的部署场景——128 倍压缩使 KV 缓存占用降到极低水平

常见误区

  • HCA 不是「丢掉 127/128 的信息」——它通过学习的压缩函数将 128 个 token 的语义浓缩为一个向量
  • HCA 的「密集注意力」不等于标准全量注意力——它是在压缩后的极短序列上做密集计算,成本远低于原始序列

实际案例

📌 百万 token 的图书馆比喻

如果把百万 token 比作一百万页的图书馆:CSA 是每 4 页做一张摘要卡,再挑最相关的几张细读;HCA 是每 128 页做一张摘要卡,总共只有约 7800 张,全部通读。两种策略互补,既不遗漏全局信息,又能精准定位关键细节。

关于HCA的常见问题

HCA 压缩 128 倍不会丢信息吗
会有信息损失,但通过学习的压缩函数(softmax 门控池化)保留了关键语义。同时 128 token 的滑动窗口保证最近上下文不被压缩,CSA 层补充细粒度选择。
为什么 HCA 不需要稀疏选择
因为 128 倍压缩后序列已经极短(百万 token → 约 7800 块),对全部块做密集注意力的计算量本身就很低,不需要再做 top-k 筛选。

与HCA相关的术语