LELexEdge词汇锋面
AI专业术语

ChunkingvsEmbedding

AI领域术语对比 — 快速理解两者的核心差异

概览对比

Chunking

Chunking 是 RAG 系统的第一步:将长文档切分为适合 Embedding 和检索的小段落。切分策略直接影响检索质量——切太大信息稀释,切太小丢失上下文。

Embedding

Embedding 将文本映射到高维向量空间,语义相近的文本在向量空间中距离更近。这是 RAG、语义搜索和推荐系统的基础技术。

核心要点

Chunking

  • chunk 大小通常在 256-1024 tokens 之间
  • 按语义边界切分优于固定长度切分
  • overlap(重叠)可以减少信息丢失

Embedding

  • 语义相近的文本向量距离更近
  • 是 RAG 和语义搜索的基础
  • OpenAI text-embedding-3 和开源 BGE 是主流选择

正式定义

Chunking

将长文档按照特定策略切分为适合检索和处理的小段落的预处理技术

Embedding

将文本转换为高维数值向量以捕捉语义信息的表示学习技术

应用场景

Chunking

  • RAG 系统的文档预处理
  • 长文档的结构化索引
  • 知识库的内容组织

Embedding

  • RAG 系统的文档和查询向量化
  • 语义搜索和相似度匹配
  • 推荐系统的内容表示

详细解读

Chunking

Chunking 看似简单但对 RAG 效果影响巨大。常见策略包括:固定长度切分(简单但可能切断语义)、按段落/章节切分(保持语义完整但大小不均)、递归切分(先按大结构再按小结构)、语义切分(用模型判断语义边界)。chunk 之间通常设置 10-20% 的 overlap 以避免边界信息丢失。最佳 chunk 大小取决于文档类型和查询模式,需要实验调优。

Embedding

Embedding 是将离散的文本符号转换为连续向量表示的技术,使得计算机能够度量文本间的语义相似度。在 RAG 系统中,文档和查询都被转换为 Embedding 向量,通过余弦相似度或内积来检索最相关的文档。Embedding 模型的质量直接决定了检索效果。当前主流方案包括 OpenAI 的 text-embedding-3、开源的 BGE 和 E5 系列。多语言 Embedding 的质量仍然是挑战,中文 Embedding 的效果通常不如英文。

快速对比

维度ChunkingEmbedding
类型专业术语专业术语
标签RAG、NLPRAG、深度学习
热度6278

共同关联术语

RAGVector Database
Chunking vs Embedding | LexEdge