LELexEdge词汇锋面
AI专业术语

NLPvsTokenizer

AI领域术语对比 — 快速理解两者的核心差异

概览对比

NLP

NLP 是 AI 中专注于人类语言的分支,涵盖文本分类、情感分析、机器翻译、问答系统等任务。LLM 的出现统一了几乎所有 NLP 任务,让 NLP 从专用模型时代进入通用模型时代。

Tokenizer

Tokenizer 决定了 LLM 如何「看到」文本。不同的 Tokenizer 会将同一段文字切分成不同的 token 序列,直接影响模型的效率和能力。中文在 GPT 的 Tokenizer 中效率远低于英文。

核心要点

NLP

  • LLM 统一了几乎所有 NLP 任务
  • 从专用模型到通用模型的范式转变
  • NLP 是 AI 中最接近日常应用的领域

Tokenizer

  • BPE 是最主流的 Tokenizer 算法
  • 同样的文本,中文消耗的 token 数通常是英文的 2-3 倍
  • Tokenizer 的词表大小影响模型的多语言能力

正式定义

NLP

研究计算机理解、处理和生成人类自然语言的人工智能技术领域

Tokenizer

将原始文本切分为模型可处理的 token 序列的文本预处理组件

应用场景

NLP

  • 智能客服和对话系统
  • 文本分类和情感分析
  • 机器翻译和内容摘要

Tokenizer

  • LLM 的文本输入预处理
  • 计算 API 调用的 token 消耗
  • 评估不同语言的处理效率

详细解读

NLP

NLP 是 AI 历史最悠久的分支之一,从 1950 年代的规则系统到统计方法再到深度学习,经历了多次范式转变。2018 年 BERT 开启了预训练时代,2022 年 ChatGPT 则标志着 LLM 统一 NLP 的时代到来。传统 NLP 需要为每个任务训练专用模型,而 LLM 用一个模型就能处理翻译、摘要、分类、问答等几乎所有语言任务。NLP 的前沿方向正在从语言理解转向多模态理解和 Agent 交互。

Tokenizer

Tokenizer 是 LLM 的输入预处理组件,将原始文本转换为模型可处理的整数序列。主流算法包括 BPE(Byte Pair Encoding)、WordPiece 和 SentencePiece。Tokenizer 的设计直接影响模型效率:GPT-4 的 Tokenizer 对中文的编码效率约为英文的 1/2-1/3,意味着处理同样长度的中文需要更多 token 和更高成本。DeepSeek 等中文模型通过扩大词表来优化中文编码效率。

快速对比

维度NLPTokenizer
类型专业术语专业术语
标签NLP、机器学习LLM、NLP
热度7060

共同关联术语

LLM
NLP vs Tokenizer | LexEdge