AI专业术语
Context Window
上下文窗口 · 大模型的「工作记忆」容量
LLM模型推理
CONT
- 定义
- Context Window是AI领域的专业术语。Context Window 决定了 LLM 一次能「看到」多少内容。
最后更新:2026-03-18
什么是Context Window?
Context Window 决定了 LLM 一次能「看到」多少内容。GPT-4 Turbo 支持 128K tokens(约 10 万字),Claude 支持 200K tokens。窗口越大,模型能处理的文档越长、对话越连贯。
- 从 GPT-3 的 4K 到 Claude 的 200K,增长了 50 倍
- 长上下文不等于长记忆,中间内容容易被忽略(Lost in the Middle)
- 上下文越长推理成本越高,呈二次方增长
Context Window详解
Context Window 是 LLM 的核心参数之一,决定了模型能同时处理的信息量。早期模型的 4K token 限制严重制约了应用场景,而 128K-200K 的长上下文使得整本书的分析、长文档问答成为可能。但长上下文带来两个挑战:计算成本随长度二次方增长(FlashAttention 等技术在缓解)、以及「Lost in the Middle」现象——模型对上下文中间部分的注意力明显弱于开头和结尾。
Context Window的应用场景
正式定义
大语言模型在单次推理中能处理的最大 token 数量
应用场景
- 长文档分析和摘要
- 多轮对话的上下文保持
- 代码库级别的理解和生成
常见误区
- 上下文窗口大不等于记忆力好,模型可能忽略中间内容
- 128K 上下文不意味着能有效利用全部 128K
- 长上下文和 RAG 不是互斥的,两者可以互补
实际案例
📌 Lost in the Middle 现象
研究发现当关键信息放在 128K 上下文的中间位置时,模型的召回率从 90% 降到 50%,而放在开头或结尾时保持 90% 以上。
Context Window的参考来源
关于Context Window的常见问题
- 上下文窗口越大越好吗
- 更大的窗口能处理更长的文本,但推理成本随长度平方增长,且模型在超长上下文中容易「迷失在中间」。
- 主流模型的上下文窗口有多大
- GPT-4 Turbo 支持 128K,Claude 支持 200K,Gemini 支持 1M+,但实际有效利用率因模型而异。