news 2026/10/3 16:48:35

DeepSeek-R1 四阶段训练全解析:冷启动、推理强化学习、拒绝采样与全场景对齐

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek-R1 四阶段训练全解析:冷启动、推理强化学习、拒绝采样与全场景对齐
  • 文档
  • 教程
  • 知识库
  • 人工智能

【免费下载链接】ai-guide

程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站

项目地址:https://gitcode.com/GitHub_Trending/aig/ai-guide
点击查看免费下载

DeepSeek-R1 是 DeepSeek 团队开源的高性能推理模型,其训练管线并非单一的强化学习过程,而是由两个监督微调(SFT)阶段与两个强化学习(RL)阶段交替构成的四阶段流水线。本文以 DeepSeek-R1的四个训练阶段 为核心骨架,结合仓库内 GRPO 算法解析与 V3→R1 架构解读等资料,完整拆解冷启动、推理导向 RL、拒绝采样 SFT、全场景 RL 四个阶段的要解决的问题、数据来源与具体方法,并深入剖析其中起关键作用的 GRPO 算法原理,帮助读者建立起从基座模型到可用推理模型的完整训练认知。

为什么需要四个阶段:R1-Zero 带来的关键启示

要理解四阶段设计,必须先了解它的"前传"。DeepSeek 团队首先基于 DeepSeek-V3-Base 直接使用 GRPO 进行纯强化学习训练,得到实验模型 DeepSeek-R1-Zero——该模型完全不需要任何 SFT 种子数据。结果验证了两件事:

  • 纯 RL 可以激发推理能力:在 AIME 2024 数学竞赛基准上,R1-Zero 的 Pass@1 得分从 15.6% 跃升至 71.0%,多数投票下进一步提升至 86.7%,接近 OpenAI o1-0912 的水平;
  • 但纯 RL 存在明显缺陷:输出可读性差、语言混合(如中英文混杂)、格式不统一,无法直接产品化。

正是基于 R1-Zero 的"能力验证 + 问题暴露",DeepSeek 才设计出"冷启动 SFT 规避初期不稳定 → 推理 RL 提升能力 → 拒绝采样 SFT 扩展通用性 → 全场景 RL 对齐人类偏好"的四阶段方案。最终得到的 DeepSeek-R1 在保留强推理能力的同时,具备了规范的语言表达与通用任务能力。

四个阶段可用下表一图概括:

阶段类型核心目标输入模型关键数据/方法
第一阶段:Cold StartSFT建立规范化推理范式,规避 RL 初期不稳定DeepSeek-V3-Base数千条人工收集的高质量长链思维(CoT)数据
第二阶段:Reasoning-Oriented RLRL提升数学、代码、科学等复杂推理能力冷启动 SFT 后的检查点GRPO + 规则奖励 + 语言一致性奖励
第三阶段:Rejection Sampling & SFTSFT扩展写作、事实问答等非推理能力推理 RL 后的检查点拒绝采样生成约 60 万推理样本 + 复用 V3 约 20 万非推理样本
第四阶段:RL for All ScenariosRL人类偏好对齐,提升 Helpfulness 与 Harmlessness第三阶段 SFT 后的检查点规则奖励 + 神经奖励模型 + 多提示分布

第一阶段:Cold Start 冷启动(SFT 阶段)

要解决的问题

  • 初始不稳定性和可读性差:直接从基模型启动 RL 训练可能导致输出混乱(如语言混合、格式不统一)。R1-Zero 已经用事实证明了这一点;
  • 缺乏人类友好的推理模式:需要为模型提供初始的规范化推理行为,让模型先"学会标准答案长什么样",再进入强化学习探索。

数据来源

人工收集的数千条高质量长链思维(CoT)数据,经过格式规范化和多语言对齐处理。具体到仓库中另一篇技术解读的补充细节,冷启动数据的构建探索了几种合成方法:使用长 CoT 的 few-shot 提示作为示例直接引导模型生成详细回答;以可读格式收集 DeepSeek-R1-Zero 的输出;再通过人工标注员的后处理来完善结果,并过滤掉不易阅读的部分(见 DeepSeek技术解读:从V3到R1的MoE架构创新)。

具体方法

  1. 收集冷启动数据:通过少量高质量的长链思维(CoT)数据训练模型,数据来源包括人工设计的示例、DeepSeek-R1-Zero 输出的后处理、以及多语言对齐的格式样本(如<reasoning_process>和<summary>等结构化标签);
  2. 监督微调(SFT):用收集的数千条数据对基模型(DeepSeek-V3-Base)进行微调,确保输出格式规范且可读性强,为后续 RL 提供稳定的初始策略。

冷启动的意义在于"搭脚手架":既约束了 RL 早期的盲目探索方向,又没有限制模型的创新空间。这是 R1 与 R1-Zero 在训练路线上的根本分水岭——DeepSeek 认为,基于人类先验知识进行冷启动并迭代训练,更适合产出可用的推理模型。

第二阶段:Reasoning-Oriented RL 面向推理的强化学习(RL 阶段)

要解决的问题

  • 提升核心推理能力:增强模型在数学、代码、科学等领域的复杂推理性能;
  • 语言混合问题:确保推理过程中使用目标语言的一致性,解决 R1-Zero 遗留的"语言混搭"缺陷。

输入模型

冷启动 SFT 后的检查点。

具体方法

  1. GRPO 算法:采用分组相对策略优化(Group Relative Policy Optimization),通过规则奖励(如答案准确性、格式一致性)驱动模型优化。GRPO 不需要训练价值网络,而是对同一提示生成的多个输出(一组样本)计算组内相对奖励,从而大幅降低训练开销;
  2. 语言一致性奖励:引入语言比例奖励(如目标语言词汇占比),当模型在思维链中混入非目标语言时会获得较低的奖励,从而减少多语言混合现象。该奖励以 CoT 中目标语言单词的比例进行计算;
  3. 混合奖励信号:将准确性奖励与语言一致性奖励直接相加,形成最终奖励函数,指导模型生成更规范的推理过程。虽然语言一致性奖励可能在纯推理指标上带来轻微下降,但其目的是让输出更符合用户的阅读习惯。

此阶段主要面向编码、数学、科学和逻辑推理等推理密集型任务——这类任务定义明确、解决方案可客观验证,因此适合使用基于规则的奖励。经过该阶段的训练,模型会逐步涌现长推理链能力,甚至能像 R1-Zero 那样出现自我反思、自我修正的"顿悟时刻"(Aha Moment)——模型通过重新评估其初始方法,学会为问题分配更长的思考时间,这种能力并非通过显式编程或提示工程获得,而是强化学习环境中自发产生的涌现能力。

第三阶段:Rejection Sampling & SFT 拒绝采样与监督微调(SFT 阶段)

要解决的问题

  • 多领域能力扩展:增强模型在非推理任务(如写作、事实问答、角色扮演)上的通用性;
  • 数据质量过滤:筛选高质量的推理轨迹并生成多样化数据。

数据来源

  • 推理数据:通过拒绝采样从第二阶段的 RL 检查点生成,筛选正确的推理轨迹,约 60 万条;
  • 非推理数据:复用 DeepSeek-V3 的 SFT 数据集(写作、事实问答等),约 20 万条。

具体方法

  1. 拒绝采样生成数据:从 RL 检查点采样多个响应,仅保留正确的推理轨迹,并结合生成式奖励模型(如调用 DeepSeek-V3 判断质量)进行二次过滤。仓库中的 GRPO 详解文档进一步说明,这一环节会对每个提示生成多个回答,然后仅保留正确的响应,并过滤掉混合语言、长段落和代码块的思维链数据;
  2. 混合非推理数据:复用 DeepSeek-V3 的 SFT 数据(写作、翻译、自我认知、简单问答等),总计约 80 万样本(推理相关 60 万 + 非推理 20 万)。对于更简单的查询(例如"你好"),则不提供 CoT 回答;
  3. 两轮监督微调:用混合数据集对模型进行两轮微调(两个 epoch),平衡推理与非推理能力。

拒绝采样(Rejection Sampling)本质上是一种蒙特卡洛方法:当目标分布难以直接采样时,用一个易于采样的建议分布生成候选,再通过拒绝不满足条件的样本逼近真实目标分布。这里的作用是构建一条从 RL 检查点生成高质量 SFT 数据的"数据反哺"流水线,显著减少对人工标注的依赖,这也是 DeepSeek 四阶段训练中极具工程价值的环节。

第四阶段:RL for All Scenarios 全场景强化学习(RL 阶段)

要解决的问题

  • 与人类偏好对齐:提升模型的安全性(Harmlessness)和实用性(Helpfulness);
  • 复杂场景泛化:确保模型在开放域问答、长文本理解等任务中表现稳健。

输入模型

第三阶段 SFT 后的检查点。

具体方法

  1. 多样化奖励信号:
    • 推理任务:沿用规则奖励(数学、代码等),利用编译器反馈、标准答案比对等可客观验证的信号;
    • 通用任务:使用神经奖励模型评估人类偏好,如最终答案的实用性(Helpfulness)、全响应的无害性(Harmlessness)。对于有用性,只关注最终摘要,以最大限度减少对底层推理过程的干扰;对于无害性,则评估模型的整个响应(包括推理过程和摘要),以识别潜在风险、偏见或有害内容;
  2. 多提示分布训练:结合不同场景的提示数据(如用户查询、角色扮演、开放域对话),确保模型适应多样化需求;
  3. 二次 RL 训练:在收敛的检查点上进一步优化,最终得到兼具推理能力和通用性的 DeepSeek-R1 模型。

至此,DeepSeek-R1 的完整训练闭环形成:能力从"规范"(冷启动)到"提升"(推理 RL),再到"泛化"(拒绝采样 SFT),最后到"对齐"(全场景 RL),四阶段各司其职、层层递进。

核心引擎:GRPO 算法深入解析

GRPO(Group Relative Policy Optimization,分组相对策略优化)贯穿了第二、第四两个 RL 阶段,是整条训练管线最重要的算法支柱。其核心思想是:通过比较同一组内不同候选输出的相对表现来优化策略,而不再依赖传统的价值网络。

GRPO 的具体实现步骤

  1. 采样与奖励评分:从当前策略模型为同一提示生成多个候选输出(即多个策略组),并为每个候选输出分配奖励值,通常使用二进制奖励(如是否正确完成任务),简单且有效;
  2. 组内相对奖励:对组内奖励进行归一化处理,计算每个候选输出相对于其他候选输出的相对优势,而非绝对奖励;
  3. 策略更新:使用归一化后的奖励计算优势函数,通过最大化目标函数更新策略模型——增加选择较好候选的概率,同时降低选择较差候选的概率;
  4. 迭代训练:重复采样、评估、更新流程,逐步优化策略模型。

在更新过程中,GRPO 还引入 KL 散度约束来控制策略更新幅度,防止新旧策略分布偏差过大导致训练崩溃,这被称为"动态梯度正则化"。

GRPO 与 PPO / RLHF 的对比

对比维度PPO / 传统 RLHFGRPO
价值网络需要维护一个与策略模型规模相当的价值网络,显存与计算开销大无需价值网络,显著降低内存占用(策略模型无需额外价值模型参数)
优势计算依赖价值函数估计优势组内相对奖励归一化,简化优势计算
训练稳定性策略分布易剧烈变化,需复杂裁剪机制组内对比 + KL 散度约束,降低方差,训练更稳定
训练效率价值网络训练消耗大量资源省去价值模型,训练效率显著提升

从工程视角看,GRPO 的意义在于:对于千亿参数规模的 MoE 模型,省掉一个同等规模的价值网络意味着显存与算力的双重解放。这也是 DeepSeek 能用相对更少的算力完成推理模型训练的关键因素之一。

总结:阶段划分逻辑与四阶段定位

  • 两个 SFT 阶段:提供初始规范化能力(冷启动)和扩展多领域泛化性(混合数据微调);
  • 两个 RL 阶段:分别针对核心推理能力提升(面向推理的 RL)和人类偏好对齐(全场景 RL);
  • 核心创新:通过纯 RL 激励推理能力(无需 SFT 种子)的探索,结合冷启动和迭代优化,最终实现与顶尖闭源模型(如 OpenAI-o1-1217)匹敌的性能。

阶段划分逻辑可以概括为一条"逐步收敛"的路径:

  1. SFT 阶段 1(冷启动):提供初始推理能力与规范化格式;
  2. RL 阶段 1(推理优化):提升核心推理性能,解决语言混合;
  3. SFT 阶段 2(混合数据):扩展通用能力,覆盖写作、问答等非推理场景;
  4. RL 阶段 2(全场景对齐):最终优化与人类偏好对齐,输出兼具推理能力、安全性与实用性的完整模型。

值得一提的是,训练完成的 DeepSeek-R1 与 R1-Zero 同源于 671B 总参数 / 37B 激活参数的 MoE 架构(每个 Token 激活 8 个路由专家),上下文长度为 128K。此外,DeepSeek 还基于 R1 对 Llama 和 Qwen 系列开源模型进行了蒸馏(如 DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-70B 等),让 Dense 模型也能获得推理能力——这些内容在仓库的 V3→R1 技术解读中有更详尽的展开。

延伸阅读:仓库内的 DeepSeek 训练技术资料

本文涉及内容可在仓库中继续深入:

  • DeepSeek-R1的四个训练阶段:本文主体骨架的原始文档;
  • DeepSeek-R1的训练流程强化学习(RL)阶段采用了GRPO算法:GRPO 算法的实现细节、AIME 成绩、与 PPO 的深度对比;
  • DeepSeek技术解读:从V3到R1的MoE架构创新:R1 训练流程各阶段的补充细节、R1-Zero 训练与奖励系统设计;
  • DeepSeek-R1 技术全景解析:从原理到实践的"炼金术配方":V3、R1-Zero、R1 三者的定位对比与技术演进逻辑;
  • DeepSeek-V3 高效训练关键技术分析:R1 的基座 V3 在架构、并行策略、通信与显存优化上的高效训练技术;
  • DeepSeek技术解析目录:查看 DeepSeek 技术分析与模型训练的全部文章入口。
  • 文档
  • 教程
  • 知识库
  • 人工智能

【免费下载链接】ai-guide

程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站

项目地址:https://gitcode.com/GitHub_Trending/aig/ai-guide
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 16:48:33

【大数据毕设推荐】K-Means与FP-Growth算法实战:电动汽车品牌与车型流行趋势数据分析系统源码解析 毕业设计 选题推荐 毕设选题 数据分析 机器学习

✍✍计算机编程指导师 ⭐⭐个人介绍&#xff1a;自己非常喜欢研究技术问题&#xff01;专业做Java、Python、小程序、安卓、大数据、爬虫、Golang、大屏等实战项目。 ⛽⛽实战项目&#xff1a;有源码或者技术上的问题欢迎在评论区一起讨论交流&#xff01; ⚡⚡如果你遇到具体的…

作者头像 李华
网站建设 2026/10/3 16:46:18

2026年AI动漫短剧制作完整教程:从剧本到成片的8个环节与验收清单

本文回答&#xff1a;AI 动漫短剧从剧本到成片要过哪 8 个环节&#xff0c;每个环节产出什么、按什么验收&#xff0c;Seedance 2.0 与 2.5 两版提示词规范怎么分开写&#xff0c;以及自己用工具做、调接口、用 AI 视频产线、外包几种做法怎么选。 ai动漫短剧教程的核心是一条从…

作者头像 李华
网站建设 2026/10/3 16:42:58

步进电机控制方案:DRV8818PWPR与PIC24FJ128GA310的协同设计

做步进电机控制的这些年&#xff0c;我越来越觉得“芯片选型”这件事比写代码更重要。DRV8818PWPR这颗驱动芯片搭配PIC24FJ128GA310这颗 16 位单片机&#xff0c;是我在工业机器人和自动化设备项目里反复验证过的一套组合&#xff1a;一个负责把电流变成力矩&#xff0c;一个负…

作者头像 李华
网站建设 2026/10/3 16:42:52

在Mac上使用 OpenClaw 调用大模型 kimi-cloud:把 endpoint 改到 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/3 16:42:51

通义灵码Agent闭环工作流:用Quest模式打通AI文档到代码落地

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/3 16:42:14

EtherCAT数据高铁:工业以太网实时通信与多轴伺服同步实践

1. 为什么说EtherCAT是工业以太网的数据高铁 做运动控制这么多年&#xff0c;我见过的工业以太网方案不少&#xff0c;真正让我觉得方向对了的&#xff0c;是EtherCAT。它不是把几十年前的现场总线涂一层新颜料&#xff0c;而是重新设计了一套数据搬运方式&#xff1a;把以太网…

作者头像 李华