LELexEdge词汇锋面
AI专业术语

MMEB

Massive Multimodal Embedding Benchmark

大规模多模态嵌入基准 · 图文嵌入的统一考场

多模态NLP计算机视觉
MMEB
定义
MMEBMassive Multimodal Embedding BenchmarkAI领域的专业术语MMEB 是 MTEB 在多模态方向的延伸——不只评测文本,还评测图像、图文混合输入的嵌入质量。

最后更新:2026-03-29

什么是MMEB?

MMEB 是 MTEB 在多模态方向的延伸——不只评测文本,还评测图像、图文混合输入的嵌入质量。它包含 36 个数据集,覆盖分类、视觉问答、检索、定位四大元任务,是目前评估通用多模态嵌入模型最全面的基准之一。

  • 覆盖 36 个数据集、4 大元任务(分类/VQA/检索/定位)
  • 伴随 VLM2Vec 框架一同发布,证明视觉语言模型可转化为强嵌入模型
  • 同时评估分布内和分布外泛化能力

MMEB详解

MMEB 由 TIGER-Lab 于 2024 年提出,旨在解决多模态嵌入领域缺乏统一评测标准的问题。此前 CLIP、BLIP 等模型各自选数据集报告结果,难以横向对比。MMEB 将分类、视觉问答、图文检索、视觉定位整合为统一协议,并区分分布内与分布外测试集以评估泛化能力。配套的 VLM2Vec 框架展示了如何将 Phi-3.5-V 等视觉语言模型通过对比学习微调为通用嵌入模型,在 MMEB 上比 CLIP 等基线提升 10%-20%。2025 年进一步扩展出 MIEB(图像嵌入基准)和 MSEB(音频嵌入基准),形成完整的多模态评测生态。

MMEB的应用场景

正式定义

一个统一评测框架,通过 36 个数据集和 4 大元任务全面衡量多模态嵌入模型在图文理解与检索上的表现。

应用场景

  • 多模态嵌入模型的标准化评测与选型
  • 图文混合检索系统的性能基线测试
  • 视觉语言模型嵌入能力的研究评估

常见误区

  • MMEB 不是 MTEB 的替代品,而是多模态方向的补充
  • MMEB 目前主要覆盖图文模态,音频和视频评测由 MSEB 等扩展基准负责

实际案例

📌 VLM2Vec 在 MMEB 上的突破

TIGER-Lab 将 Phi-3.5-V 通过 LoRA 微调转化为嵌入模型,在 MMEB 上比 CLIP 和 BLIP 基线平均提升 10%-20%,证明大型视觉语言模型蕴含强大的嵌入潜力。

关于MMEB的常见问题

MMEB 和 MTEB 有什么关系
MTEB 专注纯文本嵌入评测,MMEB 扩展到图文多模态。两者设计理念一致——统一基准、公平对比,但评测的模态和任务不同。
MMEB 排行榜在哪里看
TIGER-Lab 在 Hugging Face Spaces 上维护了 MMEB Leaderboard,可查看各多模态嵌入模型的细分任务得分和总排名。

与MMEB相关的术语