LELexEdge词汇锋面
AI专业术语

RL

Reinforcement Learning

强化学习 · 让 AI 在试错中学会最优策略

机器学习深度学习
RL
定义
RLReinforcement LearningAI领域的专业术语强化学习让 AI 通过与环境交互、获得奖励或惩罚来学习最优行为策略。

最后更新:2026-03-18

什么是RL?

强化学习让 AI 通过与环境交互、获得奖励或惩罚来学习最优行为策略。AlphaGo 击败围棋世界冠军、RLHF 让 ChatGPT 变好用,背后都是强化学习。

  • 核心概念:Agent、环境、状态、动作、奖励
  • AlphaGo 和 ChatGPT 的共同技术基础
  • RLHF 和 GRPO 是 RL 在 LLM 中的应用

RL详解

强化学习是机器学习的三大范式之一(监督学习、无监督学习、强化学习),核心思想是让 Agent 通过与环境交互来学习最优策略。RL 在游戏(AlphaGo、Atari)、机器人控制和 LLM 对齐(RLHF)中取得了突破性成果。当前 RL 在 LLM 领域的应用是最热门的方向:RLHF 用于行为对齐,GRPO 用于推理能力训练。RL 的挑战包括样本效率低、训练不稳定和奖励设计困难。

RL的应用场景

正式定义

通过 Agent 与环境交互获得奖励信号来学习最优行为策略的机器学习范式

应用场景

  • LLM 的行为对齐(RLHF)
  • 游戏 AI 和机器人控制
  • 推荐系统的策略优化

常见误区

  • RL 不是让 AI 自己学会一切,奖励函数的设计是人工的
  • RL 训练通常不稳定,需要大量调参
  • RL 在 LLM 中的应用(RLHF)和传统 RL 有很大区别

实际案例

📌 AlphaGo 的强化学习

AlphaGo 通过自我对弈的强化学习,在没有人类棋谱的情况下(AlphaGo Zero)达到了超越所有人类棋手的水平,证明了 RL 在复杂决策任务上的潜力。

关于RL的常见问题

强化学习和监督学习有什么区别
监督学习从标注数据学习,强化学习通过与环境交互、根据奖励信号自主学习最优策略,不需要标注数据。
强化学习在 LLM 中怎么用
主要用于 RLHF/GRPO 等对齐训练,让模型学会按人类偏好生成回答,是 ChatGPT 成功的关键技术之一。