DPOvsRLHF
AI领域术语对比 — 快速理解两者的核心差异
DPO
Direct Preference Optimization
直接偏好优化 · RLHF 的极简替代方案
RLHF
Reinforcement Learning from Human Feedback
人类反馈强化学习 · 教 AI 说人话、做人事
概览对比
DPO
DPO 将 RLHF 的复杂三阶段流程简化为一步:直接用人类偏好数据优化模型,不需要单独训练奖励模型。训练更稳定、实现更简单,已成为开源社区最流行的对齐方法。
RLHF
RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。
核心要点
DPO
- 将 RLHF 的三阶段简化为一阶段
- 不需要训练奖励模型,直接优化策略
- 训练更稳定,超参数更少
RLHF
- ChatGPT 成功的核心秘密之一
- 流程:SFT → 训练奖励模型 → PPO 强化学习
- 正在被 DPO 等更简单的方法逐步替代
正式定义
DPO
通过直接优化模型在偏好数据对上的表现来实现人类偏好对齐的训练方法
RLHF
通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术
应用场景
DPO
- 开源模型的低成本对齐训练
- 小团队快速迭代模型行为
- 替代 RLHF 降低训练复杂度
RLHF
- 让 LLM 输出更符合人类期望
- 减少有害和偏见内容生成
- 提升模型的指令遵循能力
详细解读
DPO
DPO 由 Stanford 团队在 2023 年提出,核心洞察是:RLHF 中的奖励模型和策略优化可以合并为一个简单的分类损失函数。给定一对「好回答」和「差回答」,DPO 直接增大好回答的概率、降低差回答的概率。这大幅降低了对齐训练的工程复杂度和计算成本,使得小团队和开源社区也能做模型对齐。但 DPO 在某些场景下效果不如 RLHF,特别是需要复杂奖励信号的任务。
RLHF
RLHF 由 OpenAI 在 InstructGPT 论文中系统化提出,包含三个阶段:首先用人工标注数据做监督微调(SFT),然后训练一个奖励模型(Reward Model)来模拟人类偏好,最后用 PPO 算法优化 LLM 使其输出最大化奖励。RLHF 的挑战在于人工标注成本高、奖励模型可能被 hack、以及训练不稳定。DPO 和 GRPO 等方法正在简化这一流程。
快速对比
| 维度 | DPO | RLHF |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 78 | 85 |