Chain of ThoughtvsReAct
AI领域术语对比 — 快速理解两者的核心差异
概览对比
Chain of Thought
Chain of Thought(CoT)让 LLM 在回答前先展示推理过程,就像学生做数学题要写解题步骤一样。简单加一句「让我们一步步思考」就能大幅提升复杂推理任务的准确率。
ReAct
ReAct 是 Reasoning + Acting 的缩写,让 LLM 在解决问题时交替进行思考(Thought)和行动(Action),根据观察结果(Observation)调整下一步策略。这是最经典的 Agent 设计模式。
核心要点
Chain of Thought
- Google 在 2022 年提出,是 Prompt Engineering 的里程碑
- 在数学和逻辑推理任务上提升最显著
- DeepSeek-R1 和 o1 将 CoT 内化到了模型训练中
ReAct
- Thought → Action → Observation 的循环
- 最经典的 Agent 设计模式
- 比纯推理或纯行动都更有效
正式定义
Chain of Thought
通过引导大语言模型输出中间推理步骤来提升复杂任务准确率的提示技术
ReAct
让大语言模型交替进行推理(Reasoning)和行动(Acting)的 Agent 设计范式
应用场景
Chain of Thought
- 数学和逻辑推理问题
- 多步骤决策和规划
- 复杂问题的分析和解答
ReAct
- Agent 系统的基础决策循环
- 需要多步推理和工具调用的复杂任务
- 信息检索和问答系统
详细解读
Chain of Thought
Chain of Thought 由 Google 在 2022 年提出,核心发现是:让 LLM 输出中间推理步骤能显著提升复杂任务的准确率。在 GSM8K 数学基准上,CoT 将 PaLM-540B 的准确率从 18% 提升到 57%。CoT 的进化方向包括:Self-Consistency(多次采样取多数)、Tree of Thought(树状搜索)、以及 DeepSeek-R1 和 o1 将 CoT 内化到模型训练中,让模型自动进行深度推理。
ReAct
ReAct 由 Princeton 和 Google 在 2022 年提出,核心思想是让 LLM 像人类一样「边想边做」。在每一步中,模型先输出推理过程(Thought),然后决定执行什么操作(Action),观察结果(Observation)后再进入下一轮推理。这种模式比纯 Chain of Thought(只推理不行动)和纯 Action(不推理直接做)都更有效。ReAct 已成为几乎所有 Agent 框架的基础范式。
快速对比
| 维度 | Chain of Thought | ReAct |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | Prompt Engineering、LLM | Agent、LLM |
| 热度 | 80 | 72 |