RerankingvsSemantic Search
AI领域术语对比 — 快速理解两者的核心差异
概览对比
Reranking
Reranking 在初步检索后用更精确的模型对结果重新排序,将最相关的内容排到前面。这是 RAG 系统提升检索质量最有效的手段之一,通常能提升 10-20% 的准确率。
Semantic Search
Semantic Search 理解查询的含义而非字面文字,能找到语义相关但关键词不同的结果。搜「怎么让代码跑得更快」能找到「性能优化」的文章,这就是语义搜索的威力。
核心要点
Reranking
- 在粗检索之后做精排,两阶段检索架构
- Cross-encoder 比 Bi-encoder 更精确但更慢
- Cohere Rerank 和 BGE-Reranker 是主流选择
Semantic Search
- 理解意图而非匹配关键词
- 基于 Embedding 的向量相似度计算
- Google 搜索已大量使用语义搜索技术
正式定义
Reranking
对初步检索结果使用更精确的模型进行重新排序以提升相关性的技术
Semantic Search
基于语义理解和向量相似度而非关键词匹配的智能信息检索技术
应用场景
Reranking
- RAG 系统的检索质量优化
- 搜索引擎的结果精排
- 推荐系统的候选重排
Semantic Search
- 企业内部知识库搜索
- 电商产品的智能搜索
- RAG 系统的检索层
详细解读
Reranking
Reranking 采用两阶段检索架构:第一阶段用 Embedding 快速召回 Top-K 候选(速度优先),第二阶段用 Cross-encoder 模型对候选进行精细排序(精度优先)。Cross-encoder 同时编码查询和文档,能捕捉更细粒度的语义关系,但计算成本高,只适合对少量候选重排。在 RAG 系统中加入 Reranking 通常能将回答准确率提升 10-20%,是性价比最高的优化手段之一。
Semantic Search
Semantic Search 通过 Embedding 技术将查询和文档都转换为语义向量,用向量相似度替代传统的关键词匹配。这解决了传统搜索的「词汇鸿沟」问题——用户的表述方式和文档的用词可能完全不同,但语义是相同的。在实践中,最佳方案通常是混合搜索:结合语义搜索(召回语义相关结果)和关键词搜索(精确匹配专有名词),再用 Reranking 模型重排序。
快速对比
| 维度 | Reranking | Semantic Search |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | RAG、NLP | RAG、NLP |
| 热度 | 65 | 72 |