LELexEdge词汇锋面
AI专业术语

STS-B

Semantic Textual Similarity Benchmark

语义文本相似度基准 · 衡量模型「读懂话」的标尺

NLP模型训练
STS-
定义
STS-BSemantic Textual Similarity BenchmarkAI领域的专业术语STS-B 是 GLUE 基准中的一项任务,包含 8600+ 对英文句子,每对由人工标注 0-5 分的语义相似度。

最后更新:2026-03-29

什么是STS-B?

STS-B 是 GLUE 基准中的一项任务,包含 8600+ 对英文句子,每对由人工标注 0-5 分的语义相似度。它是训练和评估句子嵌入模型的基石数据集——Sentence-BERT、SimCSE 等经典工作都以 STS-B 上的 Spearman 相关系数作为核心指标。

  • GLUE 基准九大任务之一,2017 年发布至今仍广泛使用
  • 8600+ 句对覆盖新闻、图片描述、论坛等多领域
  • Sentence-BERT、SimCSE 等句子嵌入里程碑工作的标准评测集

STS-B详解

STS-B 源自 SemEval 系列共享任务(2012-2017),后被纳入 GLUE 基准。数据集包含来自新闻标题、图片描述和用户论坛的句子对,人工标注 0(完全无关)到 5(语义等价)的连续分数。模型需要预测这个分数,评估指标为预测值与人工标注的 Spearman/Pearson 相关系数。虽然 STS-B 规模不大且仅覆盖英文,但它的标注质量高、任务定义清晰,至今仍是句子嵌入研究的必测项。随着 MTEB 等更大规模基准的出现,STS-B 的角色从「唯一标尺」变为「基础验证集」,但在 Sentence Transformers 训练流程中依然是默认的开发集。

公式提示

评估指标:Spearman ρ = 模型预测分数与人工标注分数的秩相关系数。

STS-B的应用场景

正式定义

一个包含 8600+ 人工标注句子对的语义相似度评测数据集,用于衡量模型捕捉句间语义关系的能力。

应用场景

  • 句子嵌入模型的训练与评估
  • 语义搜索系统的质量验证
  • 文本去重和近似匹配算法的基线测试

常见误区

  • STS-B 只覆盖英文,不能直接用于评估多语言模型
  • 高 STS-B 分数不等于检索能力强——语义相似度和检索相关性是不同任务

实际案例

📌 Sentence-BERT 的评测标杆

Reimers & Gurevych 在 2019 年提出 Sentence-BERT 时,以 STS-B 上的 Spearman 相关系数从 BERT 的 29.2 提升至 85.0 作为核心论据,证明了孪生网络架构对句子嵌入的有效性。

关于STS-B的常见问题

STS-B 的分数怎么理解
0 分表示两句话完全无关,5 分表示语义完全等价。模型的评估指标是预测分数与人工标注的 Spearman 相关系数,越接近 1 越好。
STS-B 和 MTEB 是什么关系
STS-B 是 MTEB 中语义文本相似度(STS)任务类别下的一个数据集。MTEB 包含更多任务类型和数据集,是更全面的评测框架。

与STS-B相关的术语