AI专业术语
Chunking
文档切分 · RAG 的第一步,切得好不好决定检索质量
RAGNLP
CHUN
- 定义
- Chunking是AI领域的专业术语。Chunking 是 RAG 系统的第一步:将长文档切分为适合 Embedding 和检索的小段落。
最后更新:2026-03-18
什么是Chunking?
Chunking详解
Chunking 看似简单但对 RAG 效果影响巨大。常见策略包括:固定长度切分(简单但可能切断语义)、按段落/章节切分(保持语义完整但大小不均)、递归切分(先按大结构再按小结构)、语义切分(用模型判断语义边界)。chunk 之间通常设置 10-20% 的 overlap 以避免边界信息丢失。最佳 chunk 大小取决于文档类型和查询模式,需要实验调优。
Chunking的应用场景
正式定义
将长文档按照特定策略切分为适合检索和处理的小段落的预处理技术
应用场景
- RAG 系统的文档预处理
- 长文档的结构化索引
- 知识库的内容组织
常见误区
- chunk 大小不是越小越好,太小会丢失上下文
- 切分策略需要根据文档类型调整,没有万能方案
- chunk 的 overlap 设置需要平衡召回率和存储成本
实际案例
📌 语义切分 vs 固定切分
某法律文档 RAG 系统将切分策略从固定 512 tokens 改为按条款语义边界切分,检索准确率从 65% 提升到 82%,因为法律条款的完整性对理解至关重要。
Chunking的参考来源
关于Chunking的常见问题
- Chunking 的块大小怎么选
- 通常 256-1024 token,小块检索精度高但缺上下文,大块上下文完整但可能引入噪声,需根据场景实验。
- 有哪些常见的 Chunking 策略
- 固定大小切分、按段落/句子切分、递归切分、语义切分,复杂场景可结合多种策略。