Context WindowvsRAG
AI领域术语对比 — 快速理解两者的核心差异
概览对比
Context Window
Context Window 决定了 LLM 一次能「看到」多少内容。GPT-4 Turbo 支持 128K tokens(约 10 万字),Claude 支持 200K tokens。窗口越大,模型能处理的文档越长、对话越连贯。
RAG
RAG 是当前最实用的 LLM 增强技术:先从知识库中检索相关文档,再将检索结果作为上下文喂给 LLM 生成回答。这大幅减少了幻觉问题,让 AI 的回答有据可查。
核心要点
Context Window
- 从 GPT-3 的 4K 到 Claude 的 200K,增长了 50 倍
- 长上下文不等于长记忆,中间内容容易被忽略(Lost in the Middle)
- 上下文越长推理成本越高,呈二次方增长
RAG
- 解决 LLM 幻觉问题的最实用方案
- 不需要微调模型,知识库更新即时生效
- 核心流程:索引 → 检索 → 生成
正式定义
Context Window
大语言模型在单次推理中能处理的最大 token 数量
RAG
通过先检索外部知识库中的相关信息再将其作为上下文输入大语言模型来生成更准确回答的技术架构
应用场景
Context Window
- 长文档分析和摘要
- 多轮对话的上下文保持
- 代码库级别的理解和生成
RAG
- 企业知识库问答系统
- 文档智能搜索和摘要
- 客服机器人的知识增强
详细解读
Context Window
Context Window 是 LLM 的核心参数之一,决定了模型能同时处理的信息量。早期模型的 4K token 限制严重制约了应用场景,而 128K-200K 的长上下文使得整本书的分析、长文档问答成为可能。但长上下文带来两个挑战:计算成本随长度二次方增长(FlashAttention 等技术在缓解)、以及「Lost in the Middle」现象——模型对上下文中间部分的注意力明显弱于开头和结尾。
RAG
RAG 由 Meta 在 2020 年提出,已成为企业 AI 应用的标准架构。核心流程是:将文档切分为 chunk → 用 Embedding 模型转为向量 → 存入向量数据库 → 用户提问时检索相关 chunk → 将 chunk 作为上下文喂给 LLM 生成回答。RAG 的优势在于不需要微调模型、知识可实时更新、回答可溯源。挑战包括:检索质量直接影响生成质量、chunk 切分策略影响召回率、以及多跳推理场景下的检索不足。
快速对比
| 维度 | Context Window | RAG |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | LLM、模型推理 | RAG、LLM |
| 热度 | 80 | 95 |