LELexEdge词汇锋面
AI专业术语

Tokenizer

分词器 · 大模型看世界的「眼镜」

LLMNLP
TOKE
定义
TokenizerAI领域的专业术语Tokenizer 决定了 LLM 如何「看到」文本。

最后更新:2026-03-18

什么是Tokenizer?

Tokenizer 决定了 LLM 如何「看到」文本。不同的 Tokenizer 会将同一段文字切分成不同的 token 序列,直接影响模型的效率和能力。中文在 GPT 的 Tokenizer 中效率远低于英文。

  • BPE 是最主流的 Tokenizer 算法
  • 同样的文本,中文消耗的 token 数通常是英文的 2-3 倍
  • Tokenizer 的词表大小影响模型的多语言能力

Tokenizer详解

Tokenizer 是 LLM 的输入预处理组件,将原始文本转换为模型可处理的整数序列。主流算法包括 BPE(Byte Pair Encoding)、WordPiece 和 SentencePiece。Tokenizer 的设计直接影响模型效率:GPT-4 的 Tokenizer 对中文的编码效率约为英文的 1/2-1/3,意味着处理同样长度的中文需要更多 token 和更高成本。DeepSeek 等中文模型通过扩大词表来优化中文编码效率。

Tokenizer的应用场景

正式定义

将原始文本切分为模型可处理的 token 序列的文本预处理组件

应用场景

  • LLM 的文本输入预处理
  • 计算 API 调用的 token 消耗
  • 评估不同语言的处理效率

常见误区

  • Token 不等于单词,一个词可能被切成多个 token
  • 不同模型的 Tokenizer 不通用,token 数不能直接对比
  • Tokenizer 的选择会影响模型的多语言能力

实际案例

📌 中英文 token 效率差异

「人工智能」在 GPT-4 的 Tokenizer 中被编码为 2-3 个 token,而「AI」只需 1 个 token。这意味着中文用户使用 GPT API 的成本天然高于英文用户。

关于Tokenizer的常见问题

Token 和字数是什么关系
英文约 1 token ≈ 0.75 个单词,中文约 1-2 个字 ≈ 1 token,具体取决于分词器实现。
为什么不同模型的 token 数不一样
每个模型用不同的分词器和词表,同一段文本被切分成的 token 数量会不同。