AI专业术语
Tokenizer
分词器 · 大模型看世界的「眼镜」
LLMNLP
TOKE
- 定义
- Tokenizer是AI领域的专业术语。Tokenizer 决定了 LLM 如何「看到」文本。
最后更新:2026-03-18
什么是Tokenizer?
Tokenizer 决定了 LLM 如何「看到」文本。不同的 Tokenizer 会将同一段文字切分成不同的 token 序列,直接影响模型的效率和能力。中文在 GPT 的 Tokenizer 中效率远低于英文。
- BPE 是最主流的 Tokenizer 算法
- 同样的文本,中文消耗的 token 数通常是英文的 2-3 倍
- Tokenizer 的词表大小影响模型的多语言能力
Tokenizer详解
Tokenizer 是 LLM 的输入预处理组件,将原始文本转换为模型可处理的整数序列。主流算法包括 BPE(Byte Pair Encoding)、WordPiece 和 SentencePiece。Tokenizer 的设计直接影响模型效率:GPT-4 的 Tokenizer 对中文的编码效率约为英文的 1/2-1/3,意味着处理同样长度的中文需要更多 token 和更高成本。DeepSeek 等中文模型通过扩大词表来优化中文编码效率。
Tokenizer的应用场景
正式定义
将原始文本切分为模型可处理的 token 序列的文本预处理组件
应用场景
- LLM 的文本输入预处理
- 计算 API 调用的 token 消耗
- 评估不同语言的处理效率
常见误区
- Token 不等于单词,一个词可能被切成多个 token
- 不同模型的 Tokenizer 不通用,token 数不能直接对比
- Tokenizer 的选择会影响模型的多语言能力
实际案例
📌 中英文 token 效率差异
「人工智能」在 GPT-4 的 Tokenizer 中被编码为 2-3 个 token,而「AI」只需 1 个 token。这意味着中文用户使用 GPT API 的成本天然高于英文用户。
Tokenizer的参考来源
关于Tokenizer的常见问题
- Token 和字数是什么关系
- 英文约 1 token ≈ 0.75 个单词,中文约 1-2 个字 ≈ 1 token,具体取决于分词器实现。
- 为什么不同模型的 token 数不一样
- 每个模型用不同的分词器和词表,同一段文本被切分成的 token 数量会不同。