- 文档
- 教程
- 知识库
- 人工智能
【免费下载链接】ai-guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站
DeepSeek-R1 是 DeepSeek 团队开源的高性能推理模型,其训练管线并非单一的强化学习过程,而是由两个监督微调(SFT)阶段与两个强化学习(RL)阶段交替构成的四阶段流水线。本文以 DeepSeek-R1的四个训练阶段 为核心骨架,结合仓库内 GRPO 算法解析与 V3→R1 架构解读等资料,完整拆解冷启动、推理导向 RL、拒绝采样 SFT、全场景 RL 四个阶段的要解决的问题、数据来源与具体方法,并深入剖析其中起关键作用的 GRPO 算法原理,帮助读者建立起从基座模型到可用推理模型的完整训练认知。
为什么需要四个阶段:R1-Zero 带来的关键启示
要理解四阶段设计,必须先了解它的"前传"。DeepSeek 团队首先基于 DeepSeek-V3-Base 直接使用 GRPO 进行纯强化学习训练,得到实验模型 DeepSeek-R1-Zero——该模型完全不需要任何 SFT 种子数据。结果验证了两件事:
- 纯 RL 可以激发推理能力:在 AIME 2024 数学竞赛基准上,R1-Zero 的 Pass@1 得分从 15.6% 跃升至 71.0%,多数投票下进一步提升至 86.7%,接近 OpenAI o1-0912 的水平;
- 但纯 RL 存在明显缺陷:输出可读性差、语言混合(如中英文混杂)、格式不统一,无法直接产品化。
正是基于 R1-Zero 的"能力验证 + 问题暴露",DeepSeek 才设计出"冷启动 SFT 规避初期不稳定 → 推理 RL 提升能力 → 拒绝采样 SFT 扩展通用性 → 全场景 RL 对齐人类偏好"的四阶段方案。最终得到的 DeepSeek-R1 在保留强推理能力的同时,具备了规范的语言表达与通用任务能力。
四个阶段可用下表一图概括:
| 阶段 | 类型 | 核心目标 | 输入模型 | 关键数据/方法 |
|---|---|---|---|---|
| 第一阶段:Cold Start | SFT | 建立规范化推理范式,规避 RL 初期不稳定 | DeepSeek-V3-Base | 数千条人工收集的高质量长链思维(CoT)数据 |
| 第二阶段:Reasoning-Oriented RL | RL | 提升数学、代码、科学等复杂推理能力 | 冷启动 SFT 后的检查点 | GRPO + 规则奖励 + 语言一致性奖励 |
| 第三阶段:Rejection Sampling & SFT | SFT | 扩展写作、事实问答等非推理能力 | 推理 RL 后的检查点 | 拒绝采样生成约 60 万推理样本 + 复用 V3 约 20 万非推理样本 |
| 第四阶段:RL for All Scenarios | RL | 人类偏好对齐,提升 Helpfulness 与 Harmlessness | 第三阶段 SFT 后的检查点 | 规则奖励 + 神经奖励模型 + 多提示分布 |
第一阶段:Cold Start 冷启动(SFT 阶段)
要解决的问题
- 初始不稳定性和可读性差:直接从基模型启动 RL 训练可能导致输出混乱(如语言混合、格式不统一)。R1-Zero 已经用事实证明了这一点;
- 缺乏人类友好的推理模式:需要为模型提供初始的规范化推理行为,让模型先"学会标准答案长什么样",再进入强化学习探索。
数据来源
人工收集的数千条高质量长链思维(CoT)数据,经过格式规范化和多语言对齐处理。具体到仓库中另一篇技术解读的补充细节,冷启动数据的构建探索了几种合成方法:使用长 CoT 的 few-shot 提示作为示例直接引导模型生成详细回答;以可读格式收集 DeepSeek-R1-Zero 的输出;再通过人工标注员的后处理来完善结果,并过滤掉不易阅读的部分(见 DeepSeek技术解读:从V3到R1的MoE架构创新)。
具体方法
- 收集冷启动数据:通过少量高质量的长链思维(CoT)数据训练模型,数据来源包括人工设计的示例、DeepSeek-R1-Zero 输出的后处理、以及多语言对齐的格式样本(如
<reasoning_process>和<summary>等结构化标签); - 监督微调(SFT):用收集的数千条数据对基模型(DeepSeek-V3-Base)进行微调,确保输出格式规范且可读性强,为后续 RL 提供稳定的初始策略。
冷启动的意义在于"搭脚手架":既约束了 RL 早期的盲目探索方向,又没有限制模型的创新空间。这是 R1 与 R1-Zero 在训练路线上的根本分水岭——DeepSeek 认为,基于人类先验知识进行冷启动并迭代训练,更适合产出可用的推理模型。
第二阶段:Reasoning-Oriented RL 面向推理的强化学习(RL 阶段)
要解决的问题
- 提升核心推理能力:增强模型在数学、代码、科学等领域的复杂推理性能;
- 语言混合问题:确保推理过程中使用目标语言的一致性,解决 R1-Zero 遗留的"语言混搭"缺陷。
输入模型
冷启动 SFT 后的检查点。
具体方法
- GRPO 算法:采用分组相对策略优化(Group Relative Policy Optimization),通过规则奖励(如答案准确性、格式一致性)驱动模型优化。GRPO 不需要训练价值网络,而是对同一提示生成的多个输出(一组样本)计算组内相对奖励,从而大幅降低训练开销;
- 语言一致性奖励:引入语言比例奖励(如目标语言词汇占比),当模型在思维链中混入非目标语言时会获得较低的奖励,从而减少多语言混合现象。该奖励以 CoT 中目标语言单词的比例进行计算;
- 混合奖励信号:将准确性奖励与语言一致性奖励直接相加,形成最终奖励函数,指导模型生成更规范的推理过程。虽然语言一致性奖励可能在纯推理指标上带来轻微下降,但其目的是让输出更符合用户的阅读习惯。
此阶段主要面向编码、数学、科学和逻辑推理等推理密集型任务——这类任务定义明确、解决方案可客观验证,因此适合使用基于规则的奖励。经过该阶段的训练,模型会逐步涌现长推理链能力,甚至能像 R1-Zero 那样出现自我反思、自我修正的"顿悟时刻"(Aha Moment)——模型通过重新评估其初始方法,学会为问题分配更长的思考时间,这种能力并非通过显式编程或提示工程获得,而是强化学习环境中自发产生的涌现能力。
第三阶段:Rejection Sampling & SFT 拒绝采样与监督微调(SFT 阶段)
要解决的问题
- 多领域能力扩展:增强模型在非推理任务(如写作、事实问答、角色扮演)上的通用性;
- 数据质量过滤:筛选高质量的推理轨迹并生成多样化数据。
数据来源
- 推理数据:通过拒绝采样从第二阶段的 RL 检查点生成,筛选正确的推理轨迹,约 60 万条;
- 非推理数据:复用 DeepSeek-V3 的 SFT 数据集(写作、事实问答等),约 20 万条。
具体方法
- 拒绝采样生成数据:从 RL 检查点采样多个响应,仅保留正确的推理轨迹,并结合生成式奖励模型(如调用 DeepSeek-V3 判断质量)进行二次过滤。仓库中的 GRPO 详解文档进一步说明,这一环节会对每个提示生成多个回答,然后仅保留正确的响应,并过滤掉混合语言、长段落和代码块的思维链数据;
- 混合非推理数据:复用 DeepSeek-V3 的 SFT 数据(写作、翻译、自我认知、简单问答等),总计约 80 万样本(推理相关 60 万 + 非推理 20 万)。对于更简单的查询(例如"你好"),则不提供 CoT 回答;
- 两轮监督微调:用混合数据集对模型进行两轮微调(两个 epoch),平衡推理与非推理能力。
拒绝采样(Rejection Sampling)本质上是一种蒙特卡洛方法:当目标分布难以直接采样时,用一个易于采样的建议分布生成候选,再通过拒绝不满足条件的样本逼近真实目标分布。这里的作用是构建一条从 RL 检查点生成高质量 SFT 数据的"数据反哺"流水线,显著减少对人工标注的依赖,这也是 DeepSeek 四阶段训练中极具工程价值的环节。
第四阶段:RL for All Scenarios 全场景强化学习(RL 阶段)
要解决的问题
- 与人类偏好对齐:提升模型的安全性(Harmlessness)和实用性(Helpfulness);
- 复杂场景泛化:确保模型在开放域问答、长文本理解等任务中表现稳健。
输入模型
第三阶段 SFT 后的检查点。
具体方法
- 多样化奖励信号:
- 推理任务:沿用规则奖励(数学、代码等),利用编译器反馈、标准答案比对等可客观验证的信号;
- 通用任务:使用神经奖励模型评估人类偏好,如最终答案的实用性(Helpfulness)、全响应的无害性(Harmlessness)。对于有用性,只关注最终摘要,以最大限度减少对底层推理过程的干扰;对于无害性,则评估模型的整个响应(包括推理过程和摘要),以识别潜在风险、偏见或有害内容;
- 多提示分布训练:结合不同场景的提示数据(如用户查询、角色扮演、开放域对话),确保模型适应多样化需求;
- 二次 RL 训练:在收敛的检查点上进一步优化,最终得到兼具推理能力和通用性的 DeepSeek-R1 模型。
至此,DeepSeek-R1 的完整训练闭环形成:能力从"规范"(冷启动)到"提升"(推理 RL),再到"泛化"(拒绝采样 SFT),最后到"对齐"(全场景 RL),四阶段各司其职、层层递进。
核心引擎:GRPO 算法深入解析
GRPO(Group Relative Policy Optimization,分组相对策略优化)贯穿了第二、第四两个 RL 阶段,是整条训练管线最重要的算法支柱。其核心思想是:通过比较同一组内不同候选输出的相对表现来优化策略,而不再依赖传统的价值网络。
GRPO 的具体实现步骤
- 采样与奖励评分:从当前策略模型为同一提示生成多个候选输出(即多个策略组),并为每个候选输出分配奖励值,通常使用二进制奖励(如是否正确完成任务),简单且有效;
- 组内相对奖励:对组内奖励进行归一化处理,计算每个候选输出相对于其他候选输出的相对优势,而非绝对奖励;
- 策略更新:使用归一化后的奖励计算优势函数,通过最大化目标函数更新策略模型——增加选择较好候选的概率,同时降低选择较差候选的概率;
- 迭代训练:重复采样、评估、更新流程,逐步优化策略模型。
在更新过程中,GRPO 还引入 KL 散度约束来控制策略更新幅度,防止新旧策略分布偏差过大导致训练崩溃,这被称为"动态梯度正则化"。
GRPO 与 PPO / RLHF 的对比
| 对比维度 | PPO / 传统 RLHF | GRPO |
|---|---|---|
| 价值网络 | 需要维护一个与策略模型规模相当的价值网络,显存与计算开销大 | 无需价值网络,显著降低内存占用(策略模型无需额外价值模型参数) |
| 优势计算 | 依赖价值函数估计优势 | 组内相对奖励归一化,简化优势计算 |
| 训练稳定性 | 策略分布易剧烈变化,需复杂裁剪机制 | 组内对比 + KL 散度约束,降低方差,训练更稳定 |
| 训练效率 | 价值网络训练消耗大量资源 | 省去价值模型,训练效率显著提升 |
从工程视角看,GRPO 的意义在于:对于千亿参数规模的 MoE 模型,省掉一个同等规模的价值网络意味着显存与算力的双重解放。这也是 DeepSeek 能用相对更少的算力完成推理模型训练的关键因素之一。
总结:阶段划分逻辑与四阶段定位
- 两个 SFT 阶段:提供初始规范化能力(冷启动)和扩展多领域泛化性(混合数据微调);
- 两个 RL 阶段:分别针对核心推理能力提升(面向推理的 RL)和人类偏好对齐(全场景 RL);
- 核心创新:通过纯 RL 激励推理能力(无需 SFT 种子)的探索,结合冷启动和迭代优化,最终实现与顶尖闭源模型(如 OpenAI-o1-1217)匹敌的性能。
阶段划分逻辑可以概括为一条"逐步收敛"的路径:
- SFT 阶段 1(冷启动):提供初始推理能力与规范化格式;
- RL 阶段 1(推理优化):提升核心推理性能,解决语言混合;
- SFT 阶段 2(混合数据):扩展通用能力,覆盖写作、问答等非推理场景;
- RL 阶段 2(全场景对齐):最终优化与人类偏好对齐,输出兼具推理能力、安全性与实用性的完整模型。
值得一提的是,训练完成的 DeepSeek-R1 与 R1-Zero 同源于 671B 总参数 / 37B 激活参数的 MoE 架构(每个 Token 激活 8 个路由专家),上下文长度为 128K。此外,DeepSeek 还基于 R1 对 Llama 和 Qwen 系列开源模型进行了蒸馏(如 DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-70B 等),让 Dense 模型也能获得推理能力——这些内容在仓库的 V3→R1 技术解读中有更详尽的展开。
延伸阅读:仓库内的 DeepSeek 训练技术资料
本文涉及内容可在仓库中继续深入:
- DeepSeek-R1的四个训练阶段:本文主体骨架的原始文档;
- DeepSeek-R1的训练流程强化学习(RL)阶段采用了GRPO算法:GRPO 算法的实现细节、AIME 成绩、与 PPO 的深度对比;
- DeepSeek技术解读:从V3到R1的MoE架构创新:R1 训练流程各阶段的补充细节、R1-Zero 训练与奖励系统设计;
- DeepSeek-R1 技术全景解析:从原理到实践的"炼金术配方":V3、R1-Zero、R1 三者的定位对比与技术演进逻辑;
- DeepSeek-V3 高效训练关键技术分析:R1 的基座 V3 在架构、并行策略、通信与显存优化上的高效训练技术;
- DeepSeek技术解析目录:查看 DeepSeek 技术分析与模型训练的全部文章入口。
- 文档
- 教程
- 知识库
- 人工智能
【免费下载链接】ai-guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站
相关推荐
DeepSeek-R1强化学习训练全解析:无需SFT的推理突破
DeepSeek R1强化学习训练全解析:无需SFT的推理突破 引言:重新定义大语言模型的推理能力边界 你是否还在为大语言模型(LLM)在复杂推理任务中的表现而
基础模型大模型人工智能DeepSeek一文读懂fast_obj数据结构:从mesh到纹理坐标的高效存储方案
一文读懂fast_obj数据结构:从mesh到纹理坐标的高效存储方案 想要快速加载3D模型?fast_obj作为一款高效的C语言OBJ解析器,其核心在于精心设计
DeepSeek-R1训练数据:冷启动数据在RL训练中的作用
DeepSeek R1训练数据:冷启动数据在RL训练中的作用 在大语言模型(Large Language Model, LLM)的训练过程中,强化学习(Rein
人工智能大模型推理模型强化学习模型评测DeepSeek
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考