LELexEdge词汇锋面
AI专业术语

GRPO

Group Relative Policy Optimization

群组相对策略优化 · DeepSeek 的训练秘密武器

模型训练LLM
GRPO
定义
GRPOGroup Relative Policy OptimizationAI领域的专业术语GRPO 是 DeepSeek 在训练 R1 模型时使用的核心算法,通过在一组采样回答中进行相对排序来优化模型,无需单独的奖励模型,训练效率极高。

最后更新:2026-03-18

什么是GRPO?

GRPO 是 DeepSeek 在训练 R1 模型时使用的核心算法,通过在一组采样回答中进行相对排序来优化模型,无需单独的奖励模型,训练效率极高。

  • DeepSeek-R1 的核心训练算法
  • 不需要奖励模型,用组内相对排序替代
  • 特别适合推理任务的强化学习训练

GRPO详解

GRPO 由 DeepSeek 团队提出,核心思想是:对同一个问题采样多个回答,用规则或验证器判断对错,然后增大正确回答的概率、降低错误回答的概率。与 PPO 相比,GRPO 不需要训练 Critic 模型,大幅降低了显存占用和训练复杂度。GRPO 在数学和编程等有明确正确答案的任务上效果特别好,是 DeepSeek-R1 实现强推理能力的关键技术。

GRPO的应用场景

正式定义

通过在采样组内进行相对策略优化来训练模型的强化学习方法

应用场景

  • 训练推理能力强的 LLM
  • 替代 PPO 降低训练成本
  • 数学和编程等可验证任务的模型优化

常见误区

  • GRPO 不是通用方法,最适合有明确正确答案的任务
  • GRPO 不是 DeepSeek 独创的全新范式,而是对 PPO 的改进
  • GRPO 的效果依赖于采样多样性和验证器质量

实际案例

📌 DeepSeek-R1 的 GRPO 训练

DeepSeek-R1 使用 GRPO 在数学推理任务上训练,模型自发学会了 Chain of Thought 推理模式,无需人工标注推理步骤,AIME 正确率从 15% 提升到 79%。

关于GRPO的常见问题

GRPO 和 PPO 有什么区别
GRPO 不需要价值网络,通过组内相对排名计算优势函数,训练更高效且显存占用更低。
GRPO 是谁提出的
由 DeepSeek 团队在 DeepSeekMath 论文中提出,后被广泛用于推理模型训练。