LELexEdge词汇锋面
AI专业术语

SFT

Supervised Fine-Tuning

监督微调 · 教模型听懂人话的第一步

模型训练LLM
SFT
定义
SFTSupervised Fine-TuningAI领域的专业术语SFT 是将预训练 LLM 变成能对话的助手的第一步。

最后更新:2026-03-18

什么是SFT?

SFT 是将预训练 LLM 变成能对话的助手的第一步。用高质量的「问题-回答」数据对训练模型,让它学会按指令格式输出,是 RLHF/DPO 之前的必要步骤。

  • 对齐训练的第一阶段,RLHF/DPO 之前的必要步骤
  • 数据质量 > 数量,几千条精标数据就够
  • SFT 决定模型的基础能力,RLHF 决定行为偏好

SFT详解

SFT 是 LLM 对齐流程中的基础环节。预训练模型只学会了语言规律,SFT 教它如何按照用户指令格式化输出。典型的 SFT 数据包含指令(instruction)、输入(input)和期望输出(output)三部分。SFT 的关键挑战是数据质量——LIMA 论文证明仅 1000 条精心标注的数据就能训练出高质量的对话模型,而低质量数据反而会损害模型能力。

SFT的应用场景

正式定义

使用人工标注的指令-回答配对数据对预训练模型进行监督学习的微调方法

应用场景

  • 将预训练模型转化为对话助手
  • 教模型遵循特定格式和风格
  • 为后续 RLHF/DPO 对齐打基础

常见误区

  • SFT 不等于 Fine-tuning,SFT 特指用指令数据的监督微调
  • SFT 数据不是越多越好,质量远比数量重要
  • SFT 后的模型已经能用,RLHF 是锦上添花

实际案例

📌 LIMA 的启示

Meta 的 LIMA 论文用仅 1000 条精选数据对 LLaMA-65B 做 SFT,效果媲美用数万条数据训练的模型,证明了「少而精」的数据策略。

关于SFT的常见问题

SFT 和 RLHF 的关系是什么
SFT 是 RLHF 的前置步骤,先用标注数据教模型基本的指令遵循能力,再用 RLHF 进一步对齐人类偏好。
SFT 需要多少数据
高质量 SFT 数据几千到几万条即可见效,数据质量比数量更重要。