MMEBvsMTEB
AI领域术语对比 — 快速理解两者的核心差异
MMEB
Massive Multimodal Embedding Benchmark
大规模多模态嵌入基准 · 图文嵌入的统一考场
MTEB
Massive Text Embedding Benchmark
大规模文本嵌入基准 · 嵌入模型的「高考成绩单」
概览对比
MMEB
MMEB 是 MTEB 在多模态方向的延伸——不只评测文本,还评测图像、图文混合输入的嵌入质量。它包含 36 个数据集,覆盖分类、视觉问答、检索、定位四大元任务,是目前评估通用多模态嵌入模型最全面的基准之一。
MTEB
MTEB 把分类、聚类、检索、语义相似度等 8 类 NLP 任务打包成统一评测框架,让不同嵌入模型在同一把尺子下比高低。Hugging Face 上的 MTEB Leaderboard 已成为选型嵌入模型的事实标准——发新模型不跑 MTEB,等于没发。
核心要点
MMEB
- 覆盖 36 个数据集、4 大元任务(分类/VQA/检索/定位)
- 伴随 VLM2Vec 框架一同发布,证明视觉语言模型可转化为强嵌入模型
- 同时评估分布内和分布外泛化能力
MTEB
- 覆盖 58+ 数据集、8 大任务类型、112 种语言
- Hugging Face Leaderboard 是嵌入模型选型的事实标准
- 2025 年升级为 MMTEB,扩展至 500+ 任务和 250+ 语言
正式定义
MMEB
一个统一评测框架,通过 36 个数据集和 4 大元任务全面衡量多模态嵌入模型在图文理解与检索上的表现。
MTEB
一个聚合多数据集、多任务的标准化框架,用于全面评估文本嵌入模型在不同 NLP 场景下的表现。
应用场景
MMEB
- 多模态嵌入模型的标准化评测与选型
- 图文混合检索系统的性能基线测试
- 视觉语言模型嵌入能力的研究评估
MTEB
- 嵌入模型选型与对比
- 新模型发布时的标准化评测
- RAG 系统中检索组件的性能基线测试
详细解读
MMEB
MMEB 由 TIGER-Lab 于 2024 年提出,旨在解决多模态嵌入领域缺乏统一评测标准的问题。此前 CLIP、BLIP 等模型各自选数据集报告结果,难以横向对比。MMEB 将分类、视觉问答、图文检索、视觉定位整合为统一协议,并区分分布内与分布外测试集以评估泛化能力。配套的 VLM2Vec 框架展示了如何将 Phi-3.5-V 等视觉语言模型通过对比学习微调为通用嵌入模型,在 MMEB 上比 CLIP 等基线提升 10%-20%。2025 年进一步扩展出 MIEB(图像嵌入基准)和 MSEB(音频嵌入基准),形成完整的多模态评测生态。
MTEB
MTEB 由 Hugging Face 团队于 2022 年提出,将分类、聚类、配对分类、重排序、检索、语义文本相似度(STS)、摘要等任务整合为统一评测协议,使用 F1、v-measure、nDCG@10 等标准化指标。它解决了此前嵌入模型各自选数据集「刷分」的问题,让对比真正公平。2025 年 ICLR 上发布的 MMTEB 进一步扩展至多语言维度,覆盖 250+ 语言和 500+ 任务,发现小型多语言模型在许多场景下可超越大型 LLM。选模型时需注意:总分高不代表每项任务都强,应根据实际场景看细分得分。
快速对比
| 维度 | MMEB | MTEB |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 多模态、NLP、计算机视觉 | NLP、模型训练、模型推理 |
| 热度 | 68 | 88 |