LELexEdge词汇锋面
AI专业术语

ChunkingvsVector Database

AI领域术语对比 — 快速理解两者的核心差异

概览对比

Chunking

Chunking 是 RAG 系统的第一步:将长文档切分为适合 Embedding 和检索的小段落。切分策略直接影响检索质量——切太大信息稀释,切太小丢失上下文。

Vector Database

Vector Database 专门用于存储 Embedding 向量并支持高效的相似度搜索。Pinecone、Weaviate、Milvus 是最流行的向量数据库,也有 pgvector 等传统数据库的向量扩展。

核心要点

Chunking

  • chunk 大小通常在 256-1024 tokens 之间
  • 按语义边界切分优于固定长度切分
  • overlap(重叠)可以减少信息丢失

Vector Database

  • RAG 系统的核心存储组件
  • 支持 ANN(近似最近邻)高效检索
  • 专用 vs 扩展:Pinecone vs pgvector 各有优劣

正式定义

Chunking

将长文档按照特定策略切分为适合检索和处理的小段落的预处理技术

Vector Database

专门用于存储高维向量数据并支持高效相似度检索的数据库系统

应用场景

Chunking

  • RAG 系统的文档预处理
  • 长文档的结构化索引
  • 知识库的内容组织

Vector Database

  • RAG 系统的向量存储和检索
  • 大规模语义搜索服务
  • 推荐系统的特征存储

详细解读

Chunking

Chunking 看似简单但对 RAG 效果影响巨大。常见策略包括:固定长度切分(简单但可能切断语义)、按段落/章节切分(保持语义完整但大小不均)、递归切分(先按大结构再按小结构)、语义切分(用模型判断语义边界)。chunk 之间通常设置 10-20% 的 overlap 以避免边界信息丢失。最佳 chunk 大小取决于文档类型和查询模式,需要实验调优。

Vector Database

Vector Database 是 RAG 和语义搜索的基础设施,专门优化了高维向量的存储和相似度检索。核心技术是 ANN(Approximate Nearest Neighbor)算法,如 HNSW 和 IVF,能在毫秒级完成百万级向量的相似度搜索。市场上有两类方案:专用向量数据库(Pinecone、Weaviate、Milvus、Qdrant)和传统数据库的向量扩展(pgvector、SQLite-vec)。选择取决于规模和复杂度——小规模用 pgvector 就够,大规模需要专用方案。

快速对比

维度ChunkingVector Database
类型专业术语专业术语
标签RAG、NLPRAG、数据库
热度6278

共同关联术语

RAGEmbedding
Chunking vs Vector Database | LexEdge