AI专业术语
DPO
Direct Preference Optimization
直接偏好优化 · RLHF 的极简替代方案
模型训练LLM
DPO
- 定义
- DPO(Direct Preference Optimization)是AI领域的专业术语。DPO 将 RLHF 的复杂三阶段流程简化为一步:直接用人类偏好数据优化模型,不需要单独训练奖励模型。
最后更新:2026-03-18
什么是DPO?
DPO 将 RLHF 的复杂三阶段流程简化为一步:直接用人类偏好数据优化模型,不需要单独训练奖励模型。训练更稳定、实现更简单,已成为开源社区最流行的对齐方法。
- 将 RLHF 的三阶段简化为一阶段
- 不需要训练奖励模型,直接优化策略
- 训练更稳定,超参数更少
DPO详解
DPO 由 Stanford 团队在 2023 年提出,核心洞察是:RLHF 中的奖励模型和策略优化可以合并为一个简单的分类损失函数。给定一对「好回答」和「差回答」,DPO 直接增大好回答的概率、降低差回答的概率。这大幅降低了对齐训练的工程复杂度和计算成本,使得小团队和开源社区也能做模型对齐。但 DPO 在某些场景下效果不如 RLHF,特别是需要复杂奖励信号的任务。
DPO的应用场景
正式定义
通过直接优化模型在偏好数据对上的表现来实现人类偏好对齐的训练方法
应用场景
- 开源模型的低成本对齐训练
- 小团队快速迭代模型行为
- 替代 RLHF 降低训练复杂度
常见误区
- DPO 不是万能的,某些复杂对齐任务 RLHF 仍然更好
- DPO 的效果高度依赖偏好数据的质量
- DPO 不能替代 SFT,通常需要先做 SFT 再做 DPO
实际案例
📌 开源模型的 DPO 实践
Zephyr-7B 使用 DPO 对齐后,在 MT-Bench 上的得分超过了用 RLHF 训练的 LLaMA-2-Chat-70B,证明了 DPO 在小模型上的高效性。
DPO的参考来源
关于DPO的常见问题
- DPO 和 RLHF 有什么区别
- DPO 跳过了 RLHF 中训练奖励模型的步骤,直接用偏好数据优化策略模型,训练更简单稳定。
- DPO 适合什么场景
- 适合中小团队做模型对齐,不需要复杂的 RL 基础设施,用偏好数据对即可训练。