news 2026/10/1 8:25:37

MiniMind 学习笔记(十三):SFT 导言——从“续写文本“到“回答用户“

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MiniMind 学习笔记(十三):SFT 导言——从“续写文本“到“回答用户“

MiniMind 学习笔记(十三):SFT 导言——从"续写文本"到"回答用户"

SFT 是 Supervised Fine-Tuning(监督微调),通常接在 Pretrain 之后:用整理好的指令、问答或多轮对话数据,让一个主要学会"续写文本"的基座模型,进一步学会按照用户输入给出回答。有了 Pretrain 的基础,SFT 的训练形式会简单很多——它并没有发明一个全新的 loss,仍然是 next token prediction。真正变化的是训练数据的组织方式,以及哪些 token 会参与 loss。

文章目录

  • MiniMind 学习笔记(十三):SFT 导言——从"续写文本"到"回答用户"
    • 前言:训练链路走到哪一步了
    • 一、SFT 要解决什么问题?
      • 1.1 更一般的视角:分布迁移
    • 二、SFT 的基本样本
    • 三、MiniMind 中的 SFT 入口
    • 四、本章结构
    • 总结
    • 参考

前言:训练链路走到哪一步了

在前面的 Pretrain 篇章(笔记 #8-#12)里,我们从 loss 推导、优化器一路讲到 8GB 显卡上的实操。现在模型已经是一个"语言规律学得不错、能流畅续写"的 base 模型,但它还不是一个"助手"。SFT 就是补上这一步:

Pretrain
全 token 参与loss

SFT
指令/问答/多轮对话
只监督回答部分

后续: DPO/RLHF

大规模无标注文本

Base 模型
会续写、有知识
但不懂'被提问'

对话模型
按对话模板回答
学工具调用格式

偏好对齐模型

一、SFT 要解决什么问题?

Pretrain 阶段的模型主要学习语言规律、事实知识和上下文统计关系。它看到的是大规模普通文本,训练目标是把每个位置的下一个 token 预测对。

但一个完成 Pretrain 的模型并不天然知道"用户问一句,我应该以助手身份回答一句"。如果输入是:

什么是 SFT?

预训练模型可能会继续补全文档、百科、论坛帖子,也可能输出另一个问题——它的目标只是"像训练文本一样续写",而不是"作为助手完成用户请求"。这正是笔记 #12 末尾初步 Eval 里看到的:问"你有什么特长",pretrain 模型会接"我正在想如何开始一个新项目",而不是回答问题。

SFT 的作用,就是把训练分布改成更接近真实交互的形式:

用户提出问题 -> 助手给出回答

经过这样的训练后,模型仍然在做 next token prediction,但它预测的对象变成了"在当前对话模板下,assistant 接下来应该说什么"。

1.1 更一般的视角:分布迁移

对话式案例只是 SFT 的一种形式。由于训练目标没有变化,如果从似然损失函数的角度理解,SFT 更像是在把模型的输出分布推向某个特定的数据分布。

这个过程通常体现在风格迁移和输出结构上:

SFT 数据包含模型学到什么
对话数据一问一答的结构
数学/推理任务"按步骤输出"的模式
代码任务代码块的组织方式
Tool Call 样本工具调用的格式约定

这就是常说的行为对齐和分布迁移。沿着这个角度,更容易理解 SFT 在整个训练链路中的位置:Pretrain 决定"模型知道什么",SFT 决定"模型以什么方式表达和使用这些知识"。

同一个基座模型

SFT 对话数据
(问答/多轮)

SFT 结构化任务
(数学/代码/推理)

SFT Tool Call 数据

学出一问一答风格

学出按步骤输出模式

学出工具调用格式

本质: 输出分布向目标数据分布迁移
(训练目标本身没变)

二、SFT 的基本样本

参考 MiniMind,一个最小的 Chat SFT 样本可以抽象成两部分:

  • prompt:用户问题、系统提示、历史对话、工具说明等上下文;
  • response:希望模型学习生成的 assistant 回答。

把 prompt token 记为x 1 , x 2 , ⋯ , x m x_1, x_2, \cdots, x_mx1​,x2​,⋯,xm​,assistant 回答 token 记为y 1 , y 2 , ⋯ , y n y_1, y_2, \cdots, y_ny1​,y2​,⋯,yn​,完整输入序列:

s = [ x 1 , x 2 , ⋯ , x m , y 1 , y 2 , ⋯ , y n ] s = [x_1, x_2, \cdots, x_m, y_1, y_2, \cdots, y_n]s=[x1​,x2​,⋯,xm​,y1​,y2​,⋯,yn​]

SFT 通常只希望模型学习回答部分,因此 loss 写成:

L SFT = − ∑ t = 1 n log ⁡ p θ ( y t ∣ x 1 , ⋯ , x m , y 1 , ⋯ , y t − 1 ) \mathcal{L}_{\text{SFT}} = - \sum_{t=1}^{n} \log p_\theta(y_t \mid x_1,\cdots,x_m,y_1,\cdots,y_{t-1})LSFT​=−t=1∑n​logpθ​(yt​∣x1​,⋯,xm​,y1​,⋯,yt−1​)

这个公式表达的含义是:prompt 只是条件,真正被监督学习的是 assistant 的回答 token。

完整输入序列

loss mask = 0
不参与损失

loss mask = 1
参与损失

prompt 部分
x₁ ... xₘ
(系统提示+用户问题+历史)

response 部分
y₁ ... yₙ
(assistant 回答)

SFT Loss

对比 Pretrain 的 loss(笔记 #8):

L pretrain = − ∑ t = 1 T log ⁡ p θ ( s t ∣ s < t ) \mathcal{L}_{\text{pretrain}} = - \sum_{t=1}^{T} \log p_\theta(s_t \mid s_{<t})Lpretrain​=−t=1∑T​logpθ​(st​∣s<t​)

区别一目了然:Pretrain 对序列中所有位置计算 loss,SFT 只对 response 位置计算。具体实现中,通常在 prompt 部分的 token 上设置 loss mask(机制同笔记 #8 的loss_mask/ignore_index=-100),让它们不参与损失计算。除此之外,SFT 的 loss 和 Pretrain 的语言模型 loss 是同一种东西。

三、MiniMind 中的 SFT 入口

当前主线 SFT 数据(与笔记 #12 的数据配置表呼应):

  • sft_t2t_mini.jsonl:适合快速训练对话模型;
  • sft_t2t.jsonl:适合完整复现主线版本。

README 还特别强调,当前版本的 SFT 数据统一使用多轮对话格式,并且 Tool Calling 能力已经混入主线 SFT 数据。这意味着 SFT 不只是普通问答微调,还承担了让模型学习对话模板、思考标签和工具调用格式的职责。

MiniMind 中和本章关系最密切的文件:

文件职责
minimind_upstream/minimind/README.mdSFT 数据来源、格式和训练入口
src/minimind_learning/dataset/lm_dataset.py实现SFTDataset,把对话数据转换成input_ids和labels
src/minimind_learning/trainer/train_full_sft.py全参数 SFT 训练脚本
src/minimind_learning/trainer/train_pretrain.py用于和 SFT 脚本对比

四、本章结构

这一组 SFT 笔记按下面的顺序展开:

① SFT 数据和 Chat Template
一条样本如何从 JSONL
变成训练张量

② Full SFT vs Pretrain 脚本
只关注不同的地方
跳过重复训练细节

③ SFT 和 Pretrain 的异同
目标/数据/loss mask/
能力变化几个角度对比

④ SFT Eval
loss eval、生成式评估、
任务评估各自看什么

⑤ SFT 常见问题
容易混淆的点

  1. SFT 数据和 Chat Template:一条 SFT 样本如何从 JSONL 变成训练张量;
  2. Full SFT 和 Pretrain 脚本的区别:只关注和 Pretrain 不同的地方,跳过重复训练细节(训练基建部分见笔记 #11);
  3. SFT 和 Pretrain 的异同:从目标、数据、loss mask、能力变化几个角度对比;
  4. SFT Eval 应该怎么做:SFT loss eval、生成式评估和任务评估各自该看什么;
  5. SFT 常见问题:整理 SFT 中容易混淆的点。

总结

问题核心答案
SFT 是什么Supervised Fine-Tuning,接在 Pretrain 后,用指令/问答/多轮对话数据微调
解决什么问题Base 模型只会"像训练文本一样续写",不会"作为助手完成用户请求"
loss 变了吗没变,仍是 NTP;L SFT \mathcal{L}_{\text{SFT}}LSFT​只对 response token 求和,prompt 部分设 loss mask
更深的视角SFT = 把模型输出分布推向特定数据分布(行为对齐/分布迁移)
MiniMind 数据sft_t2t_mini(快速)/sft_t2t(主线);多轮对话格式,Tool Calling 已混入
关键代码SFTDataset(数据转换)+train_full_sft.py(训练脚本)

SFT 篇章共 5 个小节,后续将逐一展开——首先是"数据和 Chat Template":一条 SFT 样本从 JSONL 到训练张量的完整旅程。

参考

  • llm-notes-all-in-one: SFT 目标和操作
  • llm-notes-all-in-one 仓库
  • MiniMind 上游仓库
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 8:24:52

冷链货物出了问题谁负责?承运方和货主的责任怎么划分

冷链货物出了问题谁负责&#xff1f;承运方和货主的责任怎么划分冷链货损一旦发生&#xff0c;货主说是运输环节冻坏的&#xff0c;承运方说装车时货就有问题&#xff0c;双方往往先吵责任、再回头找证据。责任划分不靠谁嗓门大&#xff0c;靠的是交接凭证、温控数据和合同条款…

作者头像 李华
网站建设 2026/10/1 8:24:48

企业福利商城排名

以下是2026年国内企业福利商城综合实力排名&#xff0c;榜单以‌合规资质、供应链能力、标杆客户覆盖、系统技术成熟度‌为核心排序依据&#xff0c;覆盖不同类型头部服务商&#xff1a;1. 众麦网络科技‌核心定位‌&#xff1a;国内少有的三位一体综合型头部服务商&#xff0c…

作者头像 李华
网站建设 2026/10/1 8:24:34

MCP协议、服务与Tool三要素解析:搞清谁在指挥、谁在干活

1. 这不是又一个“协议科普”&#xff0c;而是搞清MCP生态里谁在干活、谁在指挥、谁在搬砖如果你最近翻过技术社区、AI工具评测或者低代码平台文档&#xff0c;大概率见过“MCP”这个词——它不像HTTP那样耳熟能详&#xff0c;也不像REST那样有教科书级定义&#xff0c;但它正以…

作者头像 李华
网站建设 2026/10/1 8:24:33

客户一句“太贵了、再考虑”,怎么用 AI 接住并继续跟进?

客户一句“太贵了、再考虑”&#xff0c;怎么用 AI 接住并继续跟进&#xff1f;销售过程中最常遇到的一句话就是"太贵了&#xff0c;我再考虑考虑"。很多人听到这句就不知道怎么接&#xff0c;要么急着降价&#xff0c;要么干等着没了下文。其实异议不是拒绝&#xf…

作者头像 李华
网站建设 2026/10/1 8:22:58

苏州GEO优化服务公司推荐:省心靠谱的服务商实力参考

行业选择时&#xff0c;你可能正在踩这4个典型的GEO服务痛点现在找GEO优化服务做AI搜索获客的企业越来越多&#xff0c;但很多人刚接触时根本摸不清门道&#xff0c;很容易踩坑。结合大家咨询时最常遇到的问题&#xff0c;总结了4个最普遍的踩坑点&#xff0c;看看你是不是也碰…

作者头像 李华