LELexEdge词汇锋面
AI专业术语

MTEB

Massive Text Embedding Benchmark

大规模文本嵌入基准 · 嵌入模型的「高考成绩单」

NLP模型训练模型推理
MTEB
定义
MTEBMassive Text Embedding BenchmarkAI领域的专业术语MTEB 把分类、聚类、检索、语义相似度等 8 类 NLP 任务打包成统一评测框架,让不同嵌入模型在同一把尺子下比高低。

最后更新:2026-03-29

什么是MTEB?

MTEB 把分类、聚类、检索、语义相似度等 8 类 NLP 任务打包成统一评测框架,让不同嵌入模型在同一把尺子下比高低。Hugging Face 上的 MTEB Leaderboard 已成为选型嵌入模型的事实标准——发新模型不跑 MTEB,等于没发。

  • 覆盖 58+ 数据集、8 大任务类型、112 种语言
  • Hugging Face Leaderboard 是嵌入模型选型的事实标准
  • 2025 年升级为 MMTEB,扩展至 500+ 任务和 250+ 语言

MTEB详解

MTEB 由 Hugging Face 团队于 2022 年提出,将分类、聚类、配对分类、重排序、检索、语义文本相似度(STS)、摘要等任务整合为统一评测协议,使用 F1、v-measure、nDCG@10 等标准化指标。它解决了此前嵌入模型各自选数据集「刷分」的问题,让对比真正公平。2025 年 ICLR 上发布的 MMTEB 进一步扩展至多语言维度,覆盖 250+ 语言和 500+ 任务,发现小型多语言模型在许多场景下可超越大型 LLM。选模型时需注意:总分高不代表每项任务都强,应根据实际场景看细分得分。

MTEB的应用场景

正式定义

一个聚合多数据集、多任务的标准化框架,用于全面评估文本嵌入模型在不同 NLP 场景下的表现。

应用场景

  • 嵌入模型选型与对比
  • 新模型发布时的标准化评测
  • RAG 系统中检索组件的性能基线测试

常见误区

  • MTEB 总分高不代表所有任务都强,需看细分任务得分
  • 排行榜排名频繁变动,不能只看某一时刻的快照

实际案例

📌 OpenAI text-embedding-3 发布评测

OpenAI 在发布 text-embedding-3-large 时,以 MTEB 排行榜成绩作为核心卖点,展示其在检索和分类任务上的领先表现,推动了行业对 MTEB 的广泛认可。

关于MTEB的常见问题

MTEB 排行榜怎么看
访问 Hugging Face MTEB Leaderboard,按总分或细分任务(如检索、分类)排序,结合模型大小和推理速度选择适合场景的模型。
MTEB 和 MMTEB 有什么区别
MMTEB 是 MTEB 的多语言扩展版,覆盖 250+ 语言和 500+ 任务,2025 年发布于 ICLR,更适合评估多语言嵌入能力。