LELexEdge词汇锋面
AI专业术语

Context Window

上下文窗口 · 大模型的「工作记忆」容量

LLM模型推理
CONT
定义
Context WindowAI领域的专业术语Context Window 决定了 LLM 一次能「看到」多少内容。

最后更新:2026-03-18

什么是Context Window?

Context Window 决定了 LLM 一次能「看到」多少内容。GPT-4 Turbo 支持 128K tokens(约 10 万字),Claude 支持 200K tokens。窗口越大,模型能处理的文档越长、对话越连贯。

  • 从 GPT-3 的 4K 到 Claude 的 200K,增长了 50 倍
  • 长上下文不等于长记忆,中间内容容易被忽略(Lost in the Middle)
  • 上下文越长推理成本越高,呈二次方增长

Context Window详解

Context Window 是 LLM 的核心参数之一,决定了模型能同时处理的信息量。早期模型的 4K token 限制严重制约了应用场景,而 128K-200K 的长上下文使得整本书的分析、长文档问答成为可能。但长上下文带来两个挑战:计算成本随长度二次方增长(FlashAttention 等技术在缓解)、以及「Lost in the Middle」现象——模型对上下文中间部分的注意力明显弱于开头和结尾。

Context Window的应用场景

正式定义

大语言模型在单次推理中能处理的最大 token 数量

应用场景

  • 长文档分析和摘要
  • 多轮对话的上下文保持
  • 代码库级别的理解和生成

常见误区

  • 上下文窗口大不等于记忆力好,模型可能忽略中间内容
  • 128K 上下文不意味着能有效利用全部 128K
  • 长上下文和 RAG 不是互斥的,两者可以互补

实际案例

📌 Lost in the Middle 现象

研究发现当关键信息放在 128K 上下文的中间位置时,模型的召回率从 90% 降到 50%,而放在开头或结尾时保持 90% 以上。

Context Window的参考来源

关于Context Window的常见问题

上下文窗口越大越好吗
更大的窗口能处理更长的文本,但推理成本随长度平方增长,且模型在超长上下文中容易「迷失在中间」。
主流模型的上下文窗口有多大
GPT-4 Turbo 支持 128K,Claude 支持 200K,Gemini 支持 1M+,但实际有效利用率因模型而异。