AI专业术语
DPOvsGRPO
AI领域术语对比 — 快速理解两者的核心差异
DPO
Direct Preference Optimization
直接偏好优化 · RLHF 的极简替代方案
GRPO
Group Relative Policy Optimization
群组相对策略优化 · DeepSeek 的训练秘密武器
概览对比
DPO
DPO 将 RLHF 的复杂三阶段流程简化为一步:直接用人类偏好数据优化模型,不需要单独训练奖励模型。训练更稳定、实现更简单,已成为开源社区最流行的对齐方法。
GRPO
GRPO 是 DeepSeek 在训练 R1 模型时使用的核心算法,通过在一组采样回答中进行相对排序来优化模型,无需单独的奖励模型,训练效率极高。
核心要点
DPO
- 将 RLHF 的三阶段简化为一阶段
- 不需要训练奖励模型,直接优化策略
- 训练更稳定,超参数更少
GRPO
- DeepSeek-R1 的核心训练算法
- 不需要奖励模型,用组内相对排序替代
- 特别适合推理任务的强化学习训练
正式定义
DPO
通过直接优化模型在偏好数据对上的表现来实现人类偏好对齐的训练方法
GRPO
通过在采样组内进行相对策略优化来训练模型的强化学习方法
应用场景
DPO
- 开源模型的低成本对齐训练
- 小团队快速迭代模型行为
- 替代 RLHF 降低训练复杂度
GRPO
- 训练推理能力强的 LLM
- 替代 PPO 降低训练成本
- 数学和编程等可验证任务的模型优化
详细解读
DPO
DPO 由 Stanford 团队在 2023 年提出,核心洞察是:RLHF 中的奖励模型和策略优化可以合并为一个简单的分类损失函数。给定一对「好回答」和「差回答」,DPO 直接增大好回答的概率、降低差回答的概率。这大幅降低了对齐训练的工程复杂度和计算成本,使得小团队和开源社区也能做模型对齐。但 DPO 在某些场景下效果不如 RLHF,特别是需要复杂奖励信号的任务。
GRPO
GRPO 由 DeepSeek 团队提出,核心思想是:对同一个问题采样多个回答,用规则或验证器判断对错,然后增大正确回答的概率、降低错误回答的概率。与 PPO 相比,GRPO 不需要训练 Critic 模型,大幅降低了显存占用和训练复杂度。GRPO 在数学和编程等有明确正确答案的任务上效果特别好,是 DeepSeek-R1 实现强推理能力的关键技术。
快速对比
| 维度 | DPO | GRPO |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 78 | 75 |
共同关联术语
RLHF