AI专业术语
GRPO
Group Relative Policy Optimization
群组相对策略优化 · DeepSeek 的训练秘密武器
模型训练LLM
GRPO
- 定义
- GRPO(Group Relative Policy Optimization)是AI领域的专业术语。GRPO 是 DeepSeek 在训练 R1 模型时使用的核心算法,通过在一组采样回答中进行相对排序来优化模型,无需单独的奖励模型,训练效率极高。
最后更新:2026-03-18
什么是GRPO?
GRPO 是 DeepSeek 在训练 R1 模型时使用的核心算法,通过在一组采样回答中进行相对排序来优化模型,无需单独的奖励模型,训练效率极高。
- DeepSeek-R1 的核心训练算法
- 不需要奖励模型,用组内相对排序替代
- 特别适合推理任务的强化学习训练
GRPO详解
GRPO 由 DeepSeek 团队提出,核心思想是:对同一个问题采样多个回答,用规则或验证器判断对错,然后增大正确回答的概率、降低错误回答的概率。与 PPO 相比,GRPO 不需要训练 Critic 模型,大幅降低了显存占用和训练复杂度。GRPO 在数学和编程等有明确正确答案的任务上效果特别好,是 DeepSeek-R1 实现强推理能力的关键技术。
GRPO的应用场景
正式定义
通过在采样组内进行相对策略优化来训练模型的强化学习方法
应用场景
- 训练推理能力强的 LLM
- 替代 PPO 降低训练成本
- 数学和编程等可验证任务的模型优化
常见误区
- GRPO 不是通用方法,最适合有明确正确答案的任务
- GRPO 不是 DeepSeek 独创的全新范式,而是对 PPO 的改进
- GRPO 的效果依赖于采样多样性和验证器质量
实际案例
📌 DeepSeek-R1 的 GRPO 训练
DeepSeek-R1 使用 GRPO 在数学推理任务上训练,模型自发学会了 Chain of Thought 推理模式,无需人工标注推理步骤,AIME 正确率从 15% 提升到 79%。
GRPO的参考来源
- 论文DeepSeekMath: Pushing the Limits of Mathematical ReasoningDeepSeek · 2024-02
- 文档
关于GRPO的常见问题
- GRPO 和 PPO 有什么区别
- GRPO 不需要价值网络,通过组内相对排名计算优势函数,训练更高效且显存占用更低。
- GRPO 是谁提出的
- 由 DeepSeek 团队在 DeepSeekMath 论文中提出,后被广泛用于推理模型训练。