GRPOvsRLHF
AI领域术语对比 — 快速理解两者的核心差异
GRPO
Group Relative Policy Optimization
群组相对策略优化 · DeepSeek 的训练秘密武器
RLHF
Reinforcement Learning from Human Feedback
人类反馈强化学习 · 教 AI 说人话、做人事
概览对比
GRPO
GRPO 是 DeepSeek 在训练 R1 模型时使用的核心算法,通过在一组采样回答中进行相对排序来优化模型,无需单独的奖励模型,训练效率极高。
RLHF
RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。
核心要点
GRPO
- DeepSeek-R1 的核心训练算法
- 不需要奖励模型,用组内相对排序替代
- 特别适合推理任务的强化学习训练
RLHF
- ChatGPT 成功的核心秘密之一
- 流程:SFT → 训练奖励模型 → PPO 强化学习
- 正在被 DPO 等更简单的方法逐步替代
正式定义
GRPO
通过在采样组内进行相对策略优化来训练模型的强化学习方法
RLHF
通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术
应用场景
GRPO
- 训练推理能力强的 LLM
- 替代 PPO 降低训练成本
- 数学和编程等可验证任务的模型优化
RLHF
- 让 LLM 输出更符合人类期望
- 减少有害和偏见内容生成
- 提升模型的指令遵循能力
详细解读
GRPO
GRPO 由 DeepSeek 团队提出,核心思想是:对同一个问题采样多个回答,用规则或验证器判断对错,然后增大正确回答的概率、降低错误回答的概率。与 PPO 相比,GRPO 不需要训练 Critic 模型,大幅降低了显存占用和训练复杂度。GRPO 在数学和编程等有明确正确答案的任务上效果特别好,是 DeepSeek-R1 实现强推理能力的关键技术。
RLHF
RLHF 由 OpenAI 在 InstructGPT 论文中系统化提出,包含三个阶段:首先用人工标注数据做监督微调(SFT),然后训练一个奖励模型(Reward Model)来模拟人类偏好,最后用 PPO 算法优化 LLM 使其输出最大化奖励。RLHF 的挑战在于人工标注成本高、奖励模型可能被 hack、以及训练不稳定。DPO 和 GRPO 等方法正在简化这一流程。
快速对比
| 维度 | GRPO | RLHF |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 75 | 85 |