LELexEdge词汇锋面
AI专业术语

EmbeddingvsVector Database

AI领域术语对比 — 快速理解两者的核心差异

概览对比

Embedding

Embedding 将文本映射到高维向量空间,语义相近的文本在向量空间中距离更近。这是 RAG、语义搜索和推荐系统的基础技术。

Vector Database

Vector Database 专门用于存储 Embedding 向量并支持高效的相似度搜索。Pinecone、Weaviate、Milvus 是最流行的向量数据库,也有 pgvector 等传统数据库的向量扩展。

核心要点

Embedding

  • 语义相近的文本向量距离更近
  • 是 RAG 和语义搜索的基础
  • OpenAI text-embedding-3 和开源 BGE 是主流选择

Vector Database

  • RAG 系统的核心存储组件
  • 支持 ANN(近似最近邻)高效检索
  • 专用 vs 扩展:Pinecone vs pgvector 各有优劣

正式定义

Embedding

将文本转换为高维数值向量以捕捉语义信息的表示学习技术

Vector Database

专门用于存储高维向量数据并支持高效相似度检索的数据库系统

应用场景

Embedding

  • RAG 系统的文档和查询向量化
  • 语义搜索和相似度匹配
  • 推荐系统的内容表示

Vector Database

  • RAG 系统的向量存储和检索
  • 大规模语义搜索服务
  • 推荐系统的特征存储

详细解读

Embedding

Embedding 是将离散的文本符号转换为连续向量表示的技术,使得计算机能够度量文本间的语义相似度。在 RAG 系统中,文档和查询都被转换为 Embedding 向量,通过余弦相似度或内积来检索最相关的文档。Embedding 模型的质量直接决定了检索效果。当前主流方案包括 OpenAI 的 text-embedding-3、开源的 BGE 和 E5 系列。多语言 Embedding 的质量仍然是挑战,中文 Embedding 的效果通常不如英文。

Vector Database

Vector Database 是 RAG 和语义搜索的基础设施,专门优化了高维向量的存储和相似度检索。核心技术是 ANN(Approximate Nearest Neighbor)算法,如 HNSW 和 IVF,能在毫秒级完成百万级向量的相似度搜索。市场上有两类方案:专用向量数据库(Pinecone、Weaviate、Milvus、Qdrant)和传统数据库的向量扩展(pgvector、SQLite-vec)。选择取决于规模和复杂度——小规模用 pgvector 就够,大规模需要专用方案。

快速对比

维度EmbeddingVector Database
类型专业术语专业术语
标签RAG、深度学习RAG、数据库
热度7878

共同关联术语

RAGSemantic Search