MiniMind 学习笔记(十三):SFT 导言——从"续写文本"到"回答用户"
SFT 是 Supervised Fine-Tuning(监督微调),通常接在 Pretrain 之后:用整理好的指令、问答或多轮对话数据,让一个主要学会"续写文本"的基座模型,进一步学会按照用户输入给出回答。有了 Pretrain 的基础,SFT 的训练形式会简单很多——它并没有发明一个全新的 loss,仍然是 next token prediction。真正变化的是训练数据的组织方式,以及哪些 token 会参与 loss。
文章目录
- MiniMind 学习笔记(十三):SFT 导言——从"续写文本"到"回答用户"
- 前言:训练链路走到哪一步了
- 一、SFT 要解决什么问题?
- 1.1 更一般的视角:分布迁移
- 二、SFT 的基本样本
- 三、MiniMind 中的 SFT 入口
- 四、本章结构
- 总结
- 参考
前言:训练链路走到哪一步了
在前面的 Pretrain 篇章(笔记 #8-#12)里,我们从 loss 推导、优化器一路讲到 8GB 显卡上的实操。现在模型已经是一个"语言规律学得不错、能流畅续写"的 base 模型,但它还不是一个"助手"。SFT 就是补上这一步:
一、SFT 要解决什么问题?
Pretrain 阶段的模型主要学习语言规律、事实知识和上下文统计关系。它看到的是大规模普通文本,训练目标是把每个位置的下一个 token 预测对。
但一个完成 Pretrain 的模型并不天然知道"用户问一句,我应该以助手身份回答一句"。如果输入是:
什么是 SFT?预训练模型可能会继续补全文档、百科、论坛帖子,也可能输出另一个问题——它的目标只是"像训练文本一样续写",而不是"作为助手完成用户请求"。这正是笔记 #12 末尾初步 Eval 里看到的:问"你有什么特长",pretrain 模型会接"我正在想如何开始一个新项目",而不是回答问题。
SFT 的作用,就是把训练分布改成更接近真实交互的形式:
用户提出问题 -> 助手给出回答经过这样的训练后,模型仍然在做 next token prediction,但它预测的对象变成了"在当前对话模板下,assistant 接下来应该说什么"。
1.1 更一般的视角:分布迁移
对话式案例只是 SFT 的一种形式。由于训练目标没有变化,如果从似然损失函数的角度理解,SFT 更像是在把模型的输出分布推向某个特定的数据分布。
这个过程通常体现在风格迁移和输出结构上:
| SFT 数据包含 | 模型学到什么 |
|---|---|
| 对话数据 | 一问一答的结构 |
| 数学/推理任务 | "按步骤输出"的模式 |
| 代码任务 | 代码块的组织方式 |
| Tool Call 样本 | 工具调用的格式约定 |
这就是常说的行为对齐和分布迁移。沿着这个角度,更容易理解 SFT 在整个训练链路中的位置:Pretrain 决定"模型知道什么",SFT 决定"模型以什么方式表达和使用这些知识"。
二、SFT 的基本样本
参考 MiniMind,一个最小的 Chat SFT 样本可以抽象成两部分:
- prompt:用户问题、系统提示、历史对话、工具说明等上下文;
- response:希望模型学习生成的 assistant 回答。
把 prompt token 记为x 1 , x 2 , ⋯ , x m x_1, x_2, \cdots, x_mx1,x2,⋯,xm,assistant 回答 token 记为y 1 , y 2 , ⋯ , y n y_1, y_2, \cdots, y_ny1,y2,⋯,yn,完整输入序列:
s = [ x 1 , x 2 , ⋯ , x m , y 1 , y 2 , ⋯ , y n ] s = [x_1, x_2, \cdots, x_m, y_1, y_2, \cdots, y_n]s=[x1,x2,⋯,xm,y1,y2,⋯,yn]
SFT 通常只希望模型学习回答部分,因此 loss 写成:
L SFT = − ∑ t = 1 n log p θ ( y t ∣ x 1 , ⋯ , x m , y 1 , ⋯ , y t − 1 ) \mathcal{L}_{\text{SFT}} = - \sum_{t=1}^{n} \log p_\theta(y_t \mid x_1,\cdots,x_m,y_1,\cdots,y_{t-1})LSFT=−t=1∑nlogpθ(yt∣x1,⋯,xm,y1,⋯,yt−1)
这个公式表达的含义是:prompt 只是条件,真正被监督学习的是 assistant 的回答 token。
对比 Pretrain 的 loss(笔记 #8):
L pretrain = − ∑ t = 1 T log p θ ( s t ∣ s < t ) \mathcal{L}_{\text{pretrain}} = - \sum_{t=1}^{T} \log p_\theta(s_t \mid s_{<t})Lpretrain=−t=1∑Tlogpθ(st∣s<t)
区别一目了然:Pretrain 对序列中所有位置计算 loss,SFT 只对 response 位置计算。具体实现中,通常在 prompt 部分的 token 上设置 loss mask(机制同笔记 #8 的loss_mask/ignore_index=-100),让它们不参与损失计算。除此之外,SFT 的 loss 和 Pretrain 的语言模型 loss 是同一种东西。
三、MiniMind 中的 SFT 入口
当前主线 SFT 数据(与笔记 #12 的数据配置表呼应):
sft_t2t_mini.jsonl:适合快速训练对话模型;sft_t2t.jsonl:适合完整复现主线版本。
README 还特别强调,当前版本的 SFT 数据统一使用多轮对话格式,并且 Tool Calling 能力已经混入主线 SFT 数据。这意味着 SFT 不只是普通问答微调,还承担了让模型学习对话模板、思考标签和工具调用格式的职责。
MiniMind 中和本章关系最密切的文件:
| 文件 | 职责 |
|---|---|
minimind_upstream/minimind/README.md | SFT 数据来源、格式和训练入口 |
src/minimind_learning/dataset/lm_dataset.py | 实现SFTDataset,把对话数据转换成input_ids和labels |
src/minimind_learning/trainer/train_full_sft.py | 全参数 SFT 训练脚本 |
src/minimind_learning/trainer/train_pretrain.py | 用于和 SFT 脚本对比 |
四、本章结构
这一组 SFT 笔记按下面的顺序展开:
- SFT 数据和 Chat Template:一条 SFT 样本如何从 JSONL 变成训练张量;
- Full SFT 和 Pretrain 脚本的区别:只关注和 Pretrain 不同的地方,跳过重复训练细节(训练基建部分见笔记 #11);
- SFT 和 Pretrain 的异同:从目标、数据、loss mask、能力变化几个角度对比;
- SFT Eval 应该怎么做:SFT loss eval、生成式评估和任务评估各自该看什么;
- SFT 常见问题:整理 SFT 中容易混淆的点。
总结
| 问题 | 核心答案 |
|---|---|
| SFT 是什么 | Supervised Fine-Tuning,接在 Pretrain 后,用指令/问答/多轮对话数据微调 |
| 解决什么问题 | Base 模型只会"像训练文本一样续写",不会"作为助手完成用户请求" |
| loss 变了吗 | 没变,仍是 NTP;L SFT \mathcal{L}_{\text{SFT}}LSFT只对 response token 求和,prompt 部分设 loss mask |
| 更深的视角 | SFT = 把模型输出分布推向特定数据分布(行为对齐/分布迁移) |
| MiniMind 数据 | sft_t2t_mini(快速)/sft_t2t(主线);多轮对话格式,Tool Calling 已混入 |
| 关键代码 | SFTDataset(数据转换)+train_full_sft.py(训练脚本) |
SFT 篇章共 5 个小节,后续将逐一展开——首先是"数据和 Chat Template":一条 SFT 样本从 JSONL 到训练张量的完整旅程。
参考
- llm-notes-all-in-one: SFT 目标和操作
- llm-notes-all-in-one 仓库
- MiniMind 上游仓库