Chain of ThoughtvsHallucination
AI领域术语对比 — 快速理解两者的核心差异
概览对比
Chain of Thought
Chain of Thought(CoT)让 LLM 在回答前先展示推理过程,就像学生做数学题要写解题步骤一样。简单加一句「让我们一步步思考」就能大幅提升复杂推理任务的准确率。
Hallucination
Hallucination 是 LLM 最大的可靠性问题——模型会自信地编造不存在的论文引用、虚构的历史事件或错误的代码逻辑。这不是 Bug,而是生成式模型的本质特征。
核心要点
Chain of Thought
- Google 在 2022 年提出,是 Prompt Engineering 的里程碑
- 在数学和逻辑推理任务上提升最显著
- DeepSeek-R1 和 o1 将 CoT 内化到了模型训练中
Hallucination
- 不是模型故意说谎,而是统计生成的固有缺陷
- RAG 和 Grounding 是当前最有效的缓解方案
- 完全消除幻觉在理论上可能不可能
正式定义
Chain of Thought
通过引导大语言模型输出中间推理步骤来提升复杂任务准确率的提示技术
Hallucination
大语言模型生成的看似合理但实际上不正确或虚构的内容
应用场景
Chain of Thought
- 数学和逻辑推理问题
- 多步骤决策和规划
- 复杂问题的分析和解答
Hallucination
- 法律和医疗等高风险场景的可靠性评估
- RAG 系统的事实性验证
- AI 生成内容的质量把控
详细解读
Chain of Thought
Chain of Thought 由 Google 在 2022 年提出,核心发现是:让 LLM 输出中间推理步骤能显著提升复杂任务的准确率。在 GSM8K 数学基准上,CoT 将 PaLM-540B 的准确率从 18% 提升到 57%。CoT 的进化方向包括:Self-Consistency(多次采样取多数)、Tree of Thought(树状搜索)、以及 DeepSeek-R1 和 o1 将 CoT 内化到模型训练中,让模型自动进行深度推理。
Hallucination
Hallucination 源于 LLM 的生成机制:模型基于概率分布逐 token 生成文本,当训练数据中缺乏相关知识时,模型会「创造性地」填补空白。幻觉分为两类:事实性幻觉(编造不存在的事实)和忠实性幻觉(与给定上下文矛盾)。当前缓解方案包括 RAG(用检索结果约束生成)、Chain of Thought(让模型展示推理过程)、以及后处理验证。但完全消除幻觉可能需要模型具备真正的世界模型,这是当前技术尚未解决的根本问题。
快速对比
| 维度 | Chain of Thought | Hallucination |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | Prompt Engineering、LLM | LLM、模型推理 |
| 热度 | 80 | 88 |