AI专业术语
DPOvsSFT
AI领域术语对比 — 快速理解两者的核心差异
概览对比
DPO
DPO 将 RLHF 的复杂三阶段流程简化为一步:直接用人类偏好数据优化模型,不需要单独训练奖励模型。训练更稳定、实现更简单,已成为开源社区最流行的对齐方法。
SFT
SFT 是将预训练 LLM 变成能对话的助手的第一步。用高质量的「问题-回答」数据对训练模型,让它学会按指令格式输出,是 RLHF/DPO 之前的必要步骤。
核心要点
DPO
- 将 RLHF 的三阶段简化为一阶段
- 不需要训练奖励模型,直接优化策略
- 训练更稳定,超参数更少
SFT
- 对齐训练的第一阶段,RLHF/DPO 之前的必要步骤
- 数据质量 > 数量,几千条精标数据就够
- SFT 决定模型的基础能力,RLHF 决定行为偏好
正式定义
DPO
通过直接优化模型在偏好数据对上的表现来实现人类偏好对齐的训练方法
SFT
使用人工标注的指令-回答配对数据对预训练模型进行监督学习的微调方法
应用场景
DPO
- 开源模型的低成本对齐训练
- 小团队快速迭代模型行为
- 替代 RLHF 降低训练复杂度
SFT
- 将预训练模型转化为对话助手
- 教模型遵循特定格式和风格
- 为后续 RLHF/DPO 对齐打基础
详细解读
DPO
DPO 由 Stanford 团队在 2023 年提出,核心洞察是:RLHF 中的奖励模型和策略优化可以合并为一个简单的分类损失函数。给定一对「好回答」和「差回答」,DPO 直接增大好回答的概率、降低差回答的概率。这大幅降低了对齐训练的工程复杂度和计算成本,使得小团队和开源社区也能做模型对齐。但 DPO 在某些场景下效果不如 RLHF,特别是需要复杂奖励信号的任务。
SFT
SFT 是 LLM 对齐流程中的基础环节。预训练模型只学会了语言规律,SFT 教它如何按照用户指令格式化输出。典型的 SFT 数据包含指令(instruction)、输入(input)和期望输出(output)三部分。SFT 的关键挑战是数据质量——LIMA 论文证明仅 1000 条精心标注的数据就能训练出高质量的对话模型,而低质量数据反而会损害模型能力。
快速对比
| 维度 | DPO | SFT |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 78 | 72 |
共同关联术语
RLHFFine-tuning