AI专业术语
Fine-tuningvsRLHF
AI领域术语对比 — 快速理解两者的核心差异
概览对比
Fine-tuning
Fine-tuning 是让通用 LLM 变成领域专家的关键技术。用几千条高质量的医疗问答数据微调 LLM,就能得到一个医疗领域的专业助手,效果远超通用模型。
RLHF
RLHF 是让 LLM 从「能说话」变成「说好话」的关键技术。ChatGPT 之所以比 GPT-3 好用得多,核心原因就是经过了 RLHF 训练,学会了遵循指令和拒绝有害请求。
核心要点
Fine-tuning
- 全量微调成本高,LoRA 等参数高效方法是主流
- 数据质量比数量更重要,100 条精标数据可能胜过 10000 条噪声数据
- 微调可能导致灾难性遗忘,需要平衡通用能力和专业能力
RLHF
- ChatGPT 成功的核心秘密之一
- 流程:SFT → 训练奖励模型 → PPO 强化学习
- 正在被 DPO 等更简单的方法逐步替代
正式定义
Fine-tuning
在预训练模型基础上使用特定领域或任务数据进行进一步训练的技术
RLHF
通过人类偏好反馈数据训练强化学习奖励模型来优化语言模型行为的技术
应用场景
Fine-tuning
- 将通用模型适配到垂直领域
- 提升模型在特定任务上的表现
- 注入企业私有知识
RLHF
- 让 LLM 输出更符合人类期望
- 减少有害和偏见内容生成
- 提升模型的指令遵循能力
详细解读
Fine-tuning
Fine-tuning 是迁移学习的核心技术,在预训练模型的基础上用任务特定数据继续训练。随着 LLM 规模增大,全量微调的成本变得不可接受,催生了 LoRA、QLoRA 等参数高效微调(PEFT)方法。当前微调的主流流程是:SFT(监督微调)→ RLHF/DPO(对齐)。微调的挑战包括数据质量把控、过拟合风险和评估困难。
RLHF
RLHF 由 OpenAI 在 InstructGPT 论文中系统化提出,包含三个阶段:首先用人工标注数据做监督微调(SFT),然后训练一个奖励模型(Reward Model)来模拟人类偏好,最后用 PPO 算法优化 LLM 使其输出最大化奖励。RLHF 的挑战在于人工标注成本高、奖励模型可能被 hack、以及训练不稳定。DPO 和 GRPO 等方法正在简化这一流程。
快速对比
| 维度 | Fine-tuning | RLHF |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 82 | 85 |
共同关联术语
LLMSFT