LELexEdge词汇锋面
AI专业术语

Chunking

文档切分 · RAG 的第一步,切得好不好决定检索质量

RAGNLP
CHUN
定义
ChunkingAI领域的专业术语Chunking 是 RAG 系统的第一步:将长文档切分为适合 Embedding 和检索的小段落。

最后更新:2026-03-18

什么是Chunking?

Chunking 是 RAG 系统的第一步:将长文档切分为适合 Embedding 和检索的小段落。切分策略直接影响检索质量——切太大信息稀释,切太小丢失上下文。

  • chunk 大小通常在 256-1024 tokens 之间
  • 按语义边界切分优于固定长度切分
  • overlap(重叠)可以减少信息丢失

Chunking详解

Chunking 看似简单但对 RAG 效果影响巨大。常见策略包括:固定长度切分(简单但可能切断语义)、按段落/章节切分(保持语义完整但大小不均)、递归切分(先按大结构再按小结构)、语义切分(用模型判断语义边界)。chunk 之间通常设置 10-20% 的 overlap 以避免边界信息丢失。最佳 chunk 大小取决于文档类型和查询模式,需要实验调优。

Chunking的应用场景

正式定义

将长文档按照特定策略切分为适合检索和处理的小段落的预处理技术

应用场景

  • RAG 系统的文档预处理
  • 长文档的结构化索引
  • 知识库的内容组织

常见误区

  • chunk 大小不是越小越好,太小会丢失上下文
  • 切分策略需要根据文档类型调整,没有万能方案
  • chunk 的 overlap 设置需要平衡召回率和存储成本

实际案例

📌 语义切分 vs 固定切分

某法律文档 RAG 系统将切分策略从固定 512 tokens 改为按条款语义边界切分,检索准确率从 65% 提升到 82%,因为法律条款的完整性对理解至关重要。

Chunking的参考来源

关于Chunking的常见问题

Chunking 的块大小怎么选
通常 256-1024 token,小块检索精度高但缺上下文,大块上下文完整但可能引入噪声,需根据场景实验。
有哪些常见的 Chunking 策略
固定大小切分、按段落/句子切分、递归切分、语义切分,复杂场景可结合多种策略。