AI专业术语
MMEB
Massive Multimodal Embedding Benchmark
大规模多模态嵌入基准 · 图文嵌入的统一考场
多模态NLP计算机视觉
MMEB
- 定义
- MMEB(Massive Multimodal Embedding Benchmark)是AI领域的专业术语。MMEB 是 MTEB 在多模态方向的延伸——不只评测文本,还评测图像、图文混合输入的嵌入质量。
最后更新:2026-03-29
什么是MMEB?
MMEB 是 MTEB 在多模态方向的延伸——不只评测文本,还评测图像、图文混合输入的嵌入质量。它包含 36 个数据集,覆盖分类、视觉问答、检索、定位四大元任务,是目前评估通用多模态嵌入模型最全面的基准之一。
- 覆盖 36 个数据集、4 大元任务(分类/VQA/检索/定位)
- 伴随 VLM2Vec 框架一同发布,证明视觉语言模型可转化为强嵌入模型
- 同时评估分布内和分布外泛化能力
MMEB详解
MMEB 由 TIGER-Lab 于 2024 年提出,旨在解决多模态嵌入领域缺乏统一评测标准的问题。此前 CLIP、BLIP 等模型各自选数据集报告结果,难以横向对比。MMEB 将分类、视觉问答、图文检索、视觉定位整合为统一协议,并区分分布内与分布外测试集以评估泛化能力。配套的 VLM2Vec 框架展示了如何将 Phi-3.5-V 等视觉语言模型通过对比学习微调为通用嵌入模型,在 MMEB 上比 CLIP 等基线提升 10%-20%。2025 年进一步扩展出 MIEB(图像嵌入基准)和 MSEB(音频嵌入基准),形成完整的多模态评测生态。
MMEB的应用场景
正式定义
一个统一评测框架,通过 36 个数据集和 4 大元任务全面衡量多模态嵌入模型在图文理解与检索上的表现。
应用场景
- 多模态嵌入模型的标准化评测与选型
- 图文混合检索系统的性能基线测试
- 视觉语言模型嵌入能力的研究评估
常见误区
- MMEB 不是 MTEB 的替代品,而是多模态方向的补充
- MMEB 目前主要覆盖图文模态,音频和视频评测由 MSEB 等扩展基准负责
实际案例
📌 VLM2Vec 在 MMEB 上的突破
TIGER-Lab 将 Phi-3.5-V 通过 LoRA 微调转化为嵌入模型,在 MMEB 上比 CLIP 和 BLIP 基线平均提升 10%-20%,证明大型视觉语言模型蕴含强大的嵌入潜力。
MMEB的参考来源
关于MMEB的常见问题
- MMEB 和 MTEB 有什么关系
- MTEB 专注纯文本嵌入评测,MMEB 扩展到图文多模态。两者设计理念一致——统一基准、公平对比,但评测的模态和任务不同。
- MMEB 排行榜在哪里看
- TIGER-Lab 在 Hugging Face Spaces 上维护了 MMEB Leaderboard,可查看各多模态嵌入模型的细分任务得分和总排名。