AI专业术语
RLHF
Reinforcement Learning from Human Feedback
人类反馈强化学习 · 教 AI 说人话、做人事
模型训练LLM
RLHF
- 定义
- RLHF(Reinforcement Learning from Human Feedback)是AI领域的专业术语。RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。
最后更新:2026-03-18
什么是RLHF?
RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。
- ChatGPT 成功的核心秘密之一
- 流程:SFT → 训练奖励模型 → PPO 强化学习
- 正在被 DPO 等更简单的方法逐步替代
RLHF详解
RLHF的应用场景
正式定义
通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术
应用场景
- 让 LLM 输出更符合人类期望
- 减少有害和偏见内容生成
- 提升模型的指令遵循能力
常见误区
- RLHF 不是让 AI 理解人类价值观,而是学习模仿人类偏好
- RLHF 不能完全消除有害输出,只是降低概率
- RLHF 的效果高度依赖标注数据的质量和一致性
实际案例
📌 InstructGPT 的突破
OpenAI 用 RLHF 将 GPT-3 训练成 InstructGPT,虽然参数量只有 1/100,但在人类评估中 InstructGPT 的输出质量反而优于原始 GPT-3。
RLHF的参考来源
- 论文
- 社区Illustrating RLHF2022-12
关于RLHF的常见问题
- RLHF 为什么重要
- RLHF 让模型学会按人类偏好回答问题,是 ChatGPT 从「能说话」到「说得好」的关键技术。
- RLHF 和 DPO 哪个更好
- DPO 更简单高效,不需要训练奖励模型,但 RLHF 在复杂对齐场景下仍有优势,两者各有适用场景。