LELexEdge词汇锋面
AI专业术语

Embedding

嵌入向量 · 把文字变成数字,让机器理解语义

RAG深度学习
EMBE
定义
EmbeddingAI领域的专业术语Embedding 将文本映射到高维向量空间,语义相近的文本在向量空间中距离更近。

最后更新:2026-03-18

什么是Embedding?

Embedding 将文本映射到高维向量空间,语义相近的文本在向量空间中距离更近。这是 RAG、语义搜索和推荐系统的基础技术。

  • 语义相近的文本向量距离更近
  • 是 RAG 和语义搜索的基础
  • OpenAI text-embedding-3 和开源 BGE 是主流选择

Embedding详解

Embedding 是将离散的文本符号转换为连续向量表示的技术,使得计算机能够度量文本间的语义相似度。在 RAG 系统中,文档和查询都被转换为 Embedding 向量,通过余弦相似度或内积来检索最相关的文档。Embedding 模型的质量直接决定了检索效果。当前主流方案包括 OpenAI 的 text-embedding-3、开源的 BGE 和 E5 系列。多语言 Embedding 的质量仍然是挑战,中文 Embedding 的效果通常不如英文。

Embedding的应用场景

正式定义

将文本转换为高维数值向量以捕捉语义信息的表示学习技术

应用场景

  • RAG 系统的文档和查询向量化
  • 语义搜索和相似度匹配
  • 推荐系统的内容表示

常见误区

  • Embedding 不是简单的关键词编码,而是捕捉语义信息
  • 不同 Embedding 模型的向量不兼容,不能混用
  • Embedding 的维度不是越高越好,需要平衡效果和效率

实际案例

📌 语义搜索 vs 关键词搜索

用户搜索「如何提高网站速度」,关键词搜索只能匹配包含这些词的文档,而基于 Embedding 的语义搜索还能找到包含「性能优化」「CDN 加速」「图片压缩」等语义相关的文档。

关于Embedding的常见问题

Embedding 是什么意思
将文本、图片等非结构化数据转换为固定长度的数值向量,使计算机能通过向量距离衡量语义相似度。
Embedding 模型怎么选
中文场景推荐 BGE、M3E,英文推荐 OpenAI text-embedding-3,选择时需考虑维度、语言支持和检索精度。