LELexEdge词汇锋面
AI专业术语

RLHF

Reinforcement Learning from Human Feedback

人类反馈强化学习 · 教 AI 说人话、做人事

模型训练LLM
RLHF
定义
RLHFReinforcement Learning from Human FeedbackAI领域的专业术语RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。

最后更新:2026-03-18

什么是RLHF?

RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。

  • ChatGPT 成功的核心秘密之一
  • 流程:SFT → 训练奖励模型 → PPO 强化学习
  • 正在被 DPO 等更简单的方法逐步替代

RLHF详解

RLHF 由 OpenAI 在 InstructGPT 论文中系统化提出,包含三个阶段:首先用人工标注数据做监督微调(SFT),然后训练一个奖励模型(Reward Model)来模拟人类偏好,最后用 PPO 算法优化 LLM 使其输出最大化奖励。RLHF 的挑战在于人工标注成本高、奖励模型可能被 hack、以及训练不稳定。DPOGRPO 等方法正在简化这一流程。

RLHF的应用场景

正式定义

通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术

应用场景

  • 让 LLM 输出更符合人类期望
  • 减少有害和偏见内容生成
  • 提升模型的指令遵循能力

常见误区

  • RLHF 不是让 AI 理解人类价值观,而是学习模仿人类偏好
  • RLHF 不能完全消除有害输出,只是降低概率
  • RLHF 的效果高度依赖标注数据的质量和一致性

实际案例

📌 InstructGPT 的突破

OpenAI 用 RLHF 将 GPT-3 训练成 InstructGPT,虽然参数量只有 1/100,但在人类评估中 InstructGPT 的输出质量反而优于原始 GPT-3。

关于RLHF的常见问题

RLHF 为什么重要
RLHF 让模型学会按人类偏好回答问题,是 ChatGPT 从「能说话」到「说得好」的关键技术。
RLHF 和 DPO 哪个更好
DPO 更简单高效,不需要训练奖励模型,但 RLHF 在复杂对齐场景下仍有优势,两者各有适用场景。