MMRvsRAG
AI领域术语对比 — 快速理解两者的核心差异
MMR
Maximal Marginal Relevance
最大边际相关性 · 让检索结果既相关又不重复
RAG
Retrieval-Augmented Generation
检索增强生成 · 给大模型配一个图书馆
概览对比
MMR
MMR 是一种信息检索排序算法,核心思想是:每选一条结果,不仅要和查询相关,还要和已选结果尽量不同。这避免了向量检索中常见的「返回一堆语义相似但内容重复的文档」问题,在 RAG 系统中被广泛用于提升 LLM 回答的信息覆盖度。
RAG
RAG 是当前最实用的 LLM 增强技术:先从知识库中检索相关文档,再将检索结果作为上下文喂给 LLM 生成回答。这大幅减少了幻觉问题,让 AI 的回答有据可查。
核心要点
MMR
- 1998 年由 Carbonell 和 Goldstein 在 CMU 提出,至今仍是检索多样性的事实标准
- 核心公式通过 λ 参数在相关性和多样性之间做权衡——λ=1 纯相关性,λ=0 纯多样性
- LangChain、LlamaIndex、Elasticsearch、Qdrant 等主流框架均内置 MMR 检索模式
RAG
- 解决 LLM 幻觉问题的最实用方案
- 不需要微调模型,知识库更新即时生效
- 核心流程:索引 → 检索 → 生成
正式定义
MMR
一种通过在相关性和多样性之间做边际权衡来对检索结果排序的算法,减少冗余的同时保持查询相关性。
RAG
通过先检索外部知识库中的相关信息再将其作为上下文输入大语言模型来生成更准确回答的技术架构
应用场景
MMR
- RAG 系统中为 LLM 提供多角度、低冗余的上下文文档
- 搜索引擎结果去重,避免返回语义高度重复的页面
- 自动摘要生成时选取覆盖面最广的关键段落
RAG
- 企业知识库问答系统
- 文档智能搜索和摘要
- 客服机器人的知识增强
详细解读
MMR
MMR 算法迭代式地构建结果集:第一步选最相关的文档,之后每一步都选「与查询相关但与已选文档最不相似」的文档。公式为 MMR = argmax[λ·Sim(d,q) - (1-λ)·max Sim(d,dᵢ)],其中 λ 控制相关性与多样性的权衡。在 RAG 场景中,MMR 确保送入 LLM 的上下文窗口包含多角度信息而非冗余内容,直接提升回答质量。2024-2025 年随着 RAG 成为 LLM 应用标配,MMR 从学术概念变成了工程必备——Elasticsearch、Qdrant、OpenSearch、Google Bigtable 等向量数据库和检索引擎均已原生支持。不过 MMR 的 λ 参数调优依赖经验,且在大规模候选集上计算开销较高,近期有 VRSD 等新算法尝试改进。
RAG
RAG 由 Meta 在 2020 年提出,已成为企业 AI 应用的标准架构。核心流程是:将文档切分为 chunk → 用 Embedding 模型转为向量 → 存入向量数据库 → 用户提问时检索相关 chunk → 将 chunk 作为上下文喂给 LLM 生成回答。RAG 的优势在于不需要微调模型、知识可实时更新、回答可溯源。挑战包括:检索质量直接影响生成质量、chunk 切分策略影响召回率、以及多跳推理场景下的检索不足。
快速对比
| 维度 | MMR | RAG |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | RAG、LLM | RAG、LLM |
| 热度 | 65 | 95 |