AI专业术语
Fine-tuningvsSFT
AI领域术语对比 — 快速理解两者的核心差异
概览对比
Fine-tuning
Fine-tuning 是让通用 LLM 变成领域专家的关键技术。用几千条高质量的医疗问答数据微调 LLM,就能得到一个医疗领域的专业助手,效果远超通用模型。
SFT
SFT 是将预训练 LLM 变成能对话的助手的第一步。用高质量的「问题-回答」数据对训练模型,让它学会按指令格式输出,是 RLHF/DPO 之前的必要步骤。
核心要点
Fine-tuning
- 全量微调成本高,LoRA 等参数高效方法是主流
- 数据质量比数量更重要,100 条精标数据可能胜过 10000 条噪声数据
- 微调可能导致灾难性遗忘,需要平衡通用能力和专业能力
SFT
- 对齐训练的第一阶段,RLHF/DPO 之前的必要步骤
- 数据质量 > 数量,几千条精标数据就够
- SFT 决定模型的基础能力,RLHF 决定行为偏好
正式定义
Fine-tuning
在预训练模型基础上使用特定领域或任务数据进行进一步训练的技术
SFT
使用人工标注的指令-回答配对数据对预训练模型进行监督学习的微调方法
应用场景
Fine-tuning
- 将通用模型适配到垂直领域
- 提升模型在特定任务上的表现
- 注入企业私有知识
SFT
- 将预训练模型转化为对话助手
- 教模型遵循特定格式和风格
- 为后续 RLHF/DPO 对齐打基础
详细解读
Fine-tuning
Fine-tuning 是迁移学习的核心技术,在预训练模型的基础上用任务特定数据继续训练。随着 LLM 规模增大,全量微调的成本变得不可接受,催生了 LoRA、QLoRA 等参数高效微调(PEFT)方法。当前微调的主流流程是:SFT(监督微调)→ RLHF/DPO(对齐)。微调的挑战包括数据质量把控、过拟合风险和评估困难。
SFT
SFT 是 LLM 对齐流程中的基础环节。预训练模型只学会了语言规律,SFT 教它如何按照用户指令格式化输出。典型的 SFT 数据包含指令(instruction)、输入(input)和期望输出(output)三部分。SFT 的关键挑战是数据质量——LIMA 论文证明仅 1000 条精心标注的数据就能训练出高质量的对话模型,而低质量数据反而会损害模型能力。
快速对比
| 维度 | Fine-tuning | SFT |
|---|---|---|
| 类型 | 专业术语 | 专业术语 |
| 标签 | 模型训练、LLM | 模型训练、LLM |
| 热度 | 82 | 72 |
共同关联术语
RLHF