RLHFvsSFT
AI领域术语对比 — 快速理解两者的核心差异
RLHF
Reinforcement Learning from Human Feedback
人类反馈强化学习 · 教 AI 说人话、做人事
SFT
Supervised Fine-Tuning
监督微调 · 教模型听懂人话的第一步
概览对比
RLHF
RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。
SFT
SFT 是将预训练 LLM 变成能对话的助手的第一步。用高质量的「问题-回答」数据对训练模型,让它学会按指令格式输出,是 RLHF/DPO 之前的必要步骤。
核心要点
RLHF
- ChatGPT 成功的核心秘密之一
- 流程:SFT → 训练奖励模型 → PPO 强化学习
- 正在被 DPO 等更简单的方法逐步替代
SFT
- 对齐训练的第一阶段,RLHF/DPO 之前的必要步骤
- 数据质量 > 数量,几千条精标数据就够
- SFT 决定模型的基础能力,RLHF 决定行为偏好
正式定义
RLHF
通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术
SFT
使用人工标注的指令-回答配对数据对预训练模型进行监督学习的微调方法
应用场景
RLHF
- 让 LLM 输出更符合人类期望
- 减少有害和偏见内容生成
- 提升模型的指令遵循能力
SFT
- 将预训练模型转化为对话助手
- 教模型遵循特定格式和风格
- 为后续 RLHF/DPO 对齐打基础
详细解读
RLHF
RLHF 由 OpenAI 在 InstructGPT 论文中系统化提出,包含三个阶段:首先用人工标注数据做监督微调(SFT),然后训练一个奖励模型(Reward Model)来模拟人类偏好,最后用 PPO 算法优化 LLM 使其输出最大化奖励。RLHF 的挑战在于人工标注成本高、奖励模型可能被 hack、以及训练不稳定。DPO 和 GRPO 等方法正在简化这一流程。
SFT
SFT 是 LLM 对齐流程中的基础环节。预训练模型只学会了语言规律,SFT 教它如何按照用户指令格式化输出。典型的 SFT 数据包含指令(instruction)、输入(input)和期望输出(output)三部分。SFT 的关键挑战是数据质量——LIMA 论文证明仅 1000 条精心标注的数据就能训练出高质量的对话模型,而低质量数据反而会损害模型能力。
快速对比
| 维度 | RLHF | SFT |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 85 | 72 |