AI专业术语
Embedding
嵌入向量 · 把文字变成数字,让机器理解语义
RAG深度学习
EMBE
- 定义
- Embedding是AI领域的专业术语。Embedding 将文本映射到高维向量空间,语义相近的文本在向量空间中距离更近。
最后更新:2026-03-18
什么是Embedding?
Embedding 将文本映射到高维向量空间,语义相近的文本在向量空间中距离更近。这是 RAG、语义搜索和推荐系统的基础技术。
- 语义相近的文本向量距离更近
- 是 RAG 和语义搜索的基础
- OpenAI text-embedding-3 和开源 BGE 是主流选择
Embedding详解
Embedding 是将离散的文本符号转换为连续向量表示的技术,使得计算机能够度量文本间的语义相似度。在 RAG 系统中,文档和查询都被转换为 Embedding 向量,通过余弦相似度或内积来检索最相关的文档。Embedding 模型的质量直接决定了检索效果。当前主流方案包括 OpenAI 的 text-embedding-3、开源的 BGE 和 E5 系列。多语言 Embedding 的质量仍然是挑战,中文 Embedding 的效果通常不如英文。
Embedding的应用场景
正式定义
将文本转换为高维数值向量以捕捉语义信息的表示学习技术
应用场景
- RAG 系统的文档和查询向量化
- 语义搜索和相似度匹配
- 推荐系统的内容表示
常见误区
- Embedding 不是简单的关键词编码,而是捕捉语义信息
- 不同 Embedding 模型的向量不兼容,不能混用
- Embedding 的维度不是越高越好,需要平衡效果和效率
实际案例
📌 语义搜索 vs 关键词搜索
用户搜索「如何提高网站速度」,关键词搜索只能匹配包含这些词的文档,而基于 Embedding 的语义搜索还能找到包含「性能优化」「CDN 加速」「图片压缩」等语义相关的文档。
Embedding的参考来源
关于Embedding的常见问题
- Embedding 是什么意思
- 将文本、图片等非结构化数据转换为固定长度的数值向量,使计算机能通过向量距离衡量语义相似度。
- Embedding 模型怎么选
- 中文场景推荐 BGE、M3E,英文推荐 OpenAI text-embedding-3,选择时需考虑维度、语言支持和检索精度。