- 文档
- 教程
- 知识库
- 人工智能
【免费下载链接】ai-guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站
DeepSeek 以抒情走心、富有文采的回答风格出圈,其背后并非玄学,而是由训练数据、后训练策略与迭代优化共同塑造的工程结果。本文以仓库内《DeepSeek华丽文风从何而来?业内人士:训练数据、训练策略和迭代优化缺一不可》一文为主体骨架,结合《DeepSeek-R1的四个训练阶段》《DeepSeek-R1的训练流程强化学习(RL)阶段采用了GRPO算法》《DeepSeek-V3 高效训练关键技术分析》等仓库文档交叉印证,完整拆解 SFT 与 RL 两步协同的机理、数据质量驱动模型性能的四个维度,以及迭代式开发流程背后的工程逻辑。读完本文,你将掌握 DeepSeek 文风背后的完整技术链路,并具备按同样思路理解其他大模型后训练策略的分析框架。
一、现象观察:让用户"找不到下巴"的文风
在深入技术原因之前,先看两个广为人知的例子,它们直观展示了 DeepSeek 的文风特征。
例一:为《哪吒之魔童闹海》中的哪吒写诗。用户给出如下提示后,DeepSeek 生成了这样的诗句节选:
"他们说我是魔、是妖、是异数。可谁见过,莲花在淤泥里,如何长出自己的形状。""我割开血肉,剔出龙筋,还给东海一个太平。却还不清,这具身体的债。""乾坤圈在手腕上,长成另一道年轮。风火轮碾过陈塘关的黄昏,碾碎每一块试图定义我的石碑。"
例二:为人物写诗。旅游博主"福瑞环宇"用 DeepSeek 写关于使徒保罗的诗,成文后感慨"写出来一看简直要去地上找下巴"——它不仅准确区分了特洛伊与特罗亚,艺术化呈现了特罗亚的地理位置与保罗在那里发生的两件要事,最后一句"一粒麦子埋入欧洲的春秋"更是惊艳深沉。
事实上,DeepSeek 不仅会写诗,其走心的回答风格已让大量用户直呼"戳中心窝"。这种华丽抒情、兼具知识准确性与文学美感的文风,展现了 AI 温暖的一面。问题随之而来:是什么技术促成了这样的风格?
二、后训练阶段的两步协同:SFT 筑基、RL 点睛
耶鲁大学助理教授杨卓然从微观角度给出的结论是:根据 DeepSeek-V3 技术报告,DeepSeek 的华丽文风主要是通过后训练阶段的两个步骤协同实现的——监督微调(SFT)与强化学习(RL)。
2.1 角色与风格能力从何而来:训练数据
上海交通大学副教授赵波通过试用发现,DeepSeek 主要包含八种角色设定:电影角色、新闻主持、历史人物、动漫游戏、文学角色、职业角色、搞笑角色和科幻角色;每种角色大类之下又分别包含其类型中的经典人物。DeepSeek 可以按照用户要求,模仿特定角色的语言或行文风格与用户交互。
这一能力的直接来源自然是训练数据。它要求开发者针对丰富的角色/风格/场景,收集对应的多轮对话和指令跟随数据来训练模型。而这些数据的来源大体可分为三类:
| 数据来源类型 | 说明 |
|---|---|
| 原始资料数据 | 直接取材于书籍、文献、网页等已有文本 |
| 人工标注数据 | 由人工撰写的示范回答与偏好标注 |
| 模型合成数据 | 由模型生成、经筛选或审核后回灌训练的高质量数据 |
其中"模型合成数据 + 人工审核"的路径,正是 DeepSeek 塑造文风的关键手段之一(详见下文 SFT 部分)。
2.2 第一步:监督微调(SFT)——文风的地基
在监督微调阶段,模型接触到了大量高质量的语言表达示例,尤其是针对创意写作等非推理任务的数据。杨卓然指出,具体来说:
- 对于创意写作任务,初始回答由DeepSeek-V2.5 生成;
- 随后经过人工审核,确保内容的准确性和风格的一致性;
- 正是在这部分数据中,模型学习到了大量语言表达优美、用词讲究的示例,为后续生成华丽文风奠定了基础。
也就是说,SFT 阶段扮演的是"授人以渔"的地基角色:它不直接产生文风,而是把"优美表达"的样本教给模型,让模型具备模仿与生成的初始能力。
2.3 第二步:强化学习(RL)——文风的点睛之笔
在强化学习阶段,模型利用奖励机制进一步优化生成结果。对于创意写作这类开放式任务:
- 奖励模型会对生成的回答进行评分,不仅要求答案准确,还鼓励模型在措辞、句式、逻辑上表现得更精致、更富有文采;
- 奖励模型基于监督微调阶段得到的 DeepSeek-V3 checkpoints 进行训练;
- 训练过程通过高温采样(高温解码增加生成多样性)与多步优化,使模型在生成时逐步融合精美的修辞和细腻的表达方式。
SFT 与 RL 的协同关系可以概括为:SFT 提供"会写"的能力底子,RL 提供"写好"的方向引导——前者注入优美的语言样本,后者用奖励信号把模型推向更精致、更有文采的表达。
2.4 交叉印证:从 R1 的四阶段训练看 SFT+RL 的完整协同
上述"SFT 筑基、RL 点睛"的逻辑,并非只体现在文风这一个侧面。仓库内《DeepSeek-R1的四个训练阶段》详细记录了 R1 的训练流程,其整体框架是两个 SFT 阶段 + 两个 RL 阶段交替推进:
| 阶段 | 类型 | 核心任务 |
|---|---|---|
| 阶段一:冷启动(Cold Start) | SFT | 用数千条人工收集的高质量长链思维(CoT)数据对 DeepSeek-V3-Base 微调,规范输出格式,为后续 RL 提供稳定初始策略 |
| 阶段二:面向推理的 RL | RL | 采用 GRPO 算法,以规则奖励(答案准确性、格式一致性)和语言一致性奖励驱动推理能力提升 |
| 阶段三:拒绝采样与 SFT | SFT | 从 RL 检查点采样约 60 万条推理数据(拒绝采样筛选)+ 复用 V3 的约 20 万条非推理数据(写作、事实问答等),两轮微调平衡推理与通用能力 |
| 阶段四:全场景 RL | RL | 结合规则奖励与神经奖励模型(人类偏好),优化有用性(Helpfulness)与无害性(Harmlessness),最终对齐 |
值得注意的是,阶段三的数据中明确包含了写作等非推理任务的数据——这正是文风类能力在 R1 训练管线中获得持续强化的位置。可以推断,DeepSeek 在塑造文风时所依赖的"多轮对话 + 指令跟随 + 人工审核"数据工程,与 R1 阶段三的"拒绝采样 + 混合 SFT 数据"方法一脉相承。
2.5 宏观视角:从 V2 到 R1 的技术演进脉络
北京邮电大学副教授白婷从 DeepSeek 多款模型的技术报告出发,梳理了其关键技术演进的宏观脉络:
- DeepSeek-V2:采用Multi-Head Latent Attention(MLA)与Sparse MoE架构。MLA 通过对注意力键值进行低秩联合压缩,减少 KV 缓存、提升推理效率;MoE 架构则通过利用多专家能力提高模型能力。
- DeepSeek-V3:在 MoE 架构基础上,加入辅助函数进行负载均衡优化,同时引入强化学习进行增强。仓库内《DeepSeek-V3 高效训练关键技术分析》进一步揭示,V3 每个 MoE 层包含 1 个共享专家和 256 个路由专家(共 58 个 MoE 层、14906 个专家),每个 Token 激活 8 个路由专家,并采用无辅助损失负载均衡与序列级负载均衡来避免"部分专家过载、部分专家闲置"的问题。
- DeepSeek-R1:聚焦推理能力,直接使用强化学习指导思维链的生成,并通过知识蒸馏将能力赋予小模型。
白婷同时强调,DeepSeek 所采用的技术并非独创,学界和业界此前已在广泛使用这些技术,甚至一些团队的某些单项技术做得更好。她认为,DeepSeek 成功的关键要素在于大量算力资源、大量高质量训练数据以及适宜的训练策略三者的组合——华丽文风或"更像人"的回复,正是受到上述关键技术手段影响的结果,但更核心的要素是高质量训练数据、训练策略与大量迭代优化的结合。
三、数据即模型:数据质量决定模型上限
如果说后训练策略是"方法",那么数据就是"原料"。2024 年 3 月,DeepSeek 研究员陈德里在一场业界大会上的演讲《和而不同:大语言模型价值观对齐解耦化》中透露了其数据工程的底层流程:
"在实际模型生产过程中,我们会进行模型的迭代式开发;即每轮的训练结束之后,都会有一个独立的测试团队,对模型在上述各个维度上的安全性进行充分的测试,并给出反馈意见来指导进行下一个周期的数据迭代和模型训练。"
这段话揭示了 DeepSeek 文风背后的第三根支柱——迭代式开发:训练 → 独立测试团队评估 → 反馈 → 数据迭代 → 再训练。文风不是一次性注入的,而是在多轮"数据迭代 + 模型训练"循环中逐步打磨出来的。
3.1 高质量数据提升表达与推理能力
优质数据包含准确、连贯且富有表现力的语言样本。例如,包含链式思考(CoT,Chain of Thought)的数据可以引导模型在推理时进行反思,进而在生成回答时展现出清晰的逻辑与优美的语言表达。这正是模型能够"既准确又有文采"的关键因素之一——准确性与文风并不矛盾,逻辑清晰本身就是文风的一部分。
3.2 高质量数据降低噪音、确保一致性
数据中的错误、噪音或不一致信息会导致模型生成内容出现语法或逻辑问题。高质量数据能有效减少这些问题,使模型更好地学习语言规律,从而提高整体生成质量。可以这样理解:低质量数据教会模型"出错"的路径,高质量数据则教会模型"正确且优美"的路径,两者在长尾输出上的差异会被逐步放大。
3.3 高质量数据提升泛化能力
数据的多样性和全面性使模型在不同领域和任务下都能生成高质量回答。丰富且准确的样本帮助模型在多种场景下自如切换风格——无论是精炼的技术解答,还是文采斐然的创意写作,都能游刃有余。这解释了为何 DeepSeek 既能写诗,也能给出严谨的技术回答:风格切换能力本质上是数据多样性在参数中的沉淀。
3.4 少量高质量数据就能显著提升能力
杨卓然特别提到,最近一些论文(如《s1: Simple test-time scaling》和《LIMO: Less is More for Reasoning》)强调数据质量的极端重要性:即便只有少量高质量数据,也能显著提升模型能力,因为高质量数据蕴含的信息更准确、更具代表性,为模型提供了高效的学习信号。这种"精炼"数据不仅帮助模型在推理和生成上达到更高水准,还能更快收敛并降低训练成本。
3.5 实例佐证:从"教科书质量"到合成数据
实例一:百家智能体大模型的"反超"实验。白婷介绍,其团队开发的百家智能体大模型(baijia.online)在阿里 Qwen-7B 上微调后,结果反超了 DeepSeek-V2.5-238B。其做法是收集大量低资源、分散的历史语料来构造训练数据和训练策略——此时模型基座的能力强弱已不再是决定性因素。换句话说,高质量训练数据能够大大增强大模型在某一目标任务上的能力。
该实验还揭示了一个值得注意的现象:DeepSeek 能很好地扮演李白这类高资源角色,但对于低资源人物的效果一般。这正是"数据质量与训练策略"两大因素共同作用的结果——白婷团队为此采用了RLAIF(Reinforcement Learning from AI Feedback)的方式,将高资源角色丰富的朝代、背景等信息迁移协同到低资源人物的构造中。
实例二:Phi-2 的"教科书质量"数据。赵波指出,2023 年微软的 Phi-2 模型使用"教科书质量"的训练数据,实现了小模型高性能。大量实例证明:小规模高质量数据能够训练出比大规模低质量数据更好的模型,且训练成本更低。
实例三:合成数据与 SVIT。合成数据已成为大模型训练数据的重要来源,通过合成可以低成本地获得大量高质量数据,主流大模型目前都大量使用合成数据。赵波团队于 2023 年 7 月推出了针对多模态大模型训练的百万级高质量合成数据集 SVIT。
综合而言,正如赵波所强调的:数据即模型,有多高质量的数据,就可以得到多强大的模型。随着训练数据的不断收集,研究团队对数据的关注重心已从数据规模转移到数据质量。
四、知识获取路径:内化与检索的权衡
在数据策略层面,DeepSeek 的回复风格(更活泼、更严谨等)背后,其实反映了工程师对对话数据的构造与提示方式的设计。而在知识获取路径上,业界存在两种典型思路:
| 路径 | 机制 | 优势 | 局限 |
|---|---|---|---|
| 预训练内化 | 将所有数据通过预训练方式写入模型参数 | 泛化性强,回答流畅 | 庞大知识易导致"专而不精",容易出现幻觉 |
| 检索召回 | 通过检索将更精准的知识召回,辅助生成 | 人机协同,回答更可信 | 依赖外部知识源的质量与检索精度 |
检索方式属于人机协同:检索的内容可以是人类构建的、带有一定可信度的网页内容、史料等,使大模型回复更加可信。理解这两条路径,有助于理解为何"文风"与"准确性"可以兼得——它们分别来自内化的语言能力与(可选)检索的知识保障。
五、尾声与展望:从文风走向更完整的智能
白婷在总结中指出,无论是 AGI 还是 Agent,其本质上都是模拟并超越人类这一目前最高等的智能体。从 DeepSeek 的设计来看:
- 早期 DeepSeek-V2 版本中多专家 MoE 的群体决策,对应人类决策时"多个视角汇合"的行为模式;
- DeepSeek-R1 版本中思维链的推理能力,对应人类"先想后答"的思考过程;
- 知识蒸馏带来的学习能力强化,对应人类"向更强个体学习"的成长路径。
但只有这些能力远远不够。更高效强大的记忆系统、共情能力、反思进化能力、个性化能力,都是大模型后续发展、超越并服务人类时需要具备的能力。文风只是这些能力在表达层面的一个缩影——它证明模型已经在"表达得像人"这一维度上迈出了坚实一步。
六、延伸阅读:仓库内同主题文档
本文为 ai-guide 仓库 DeepSeek 技术解析系列中的模型训练专题,若想进一步深入,可在仓库内继续阅读以下文档:
- DeepSeek-R1的四个训练阶段:冷启动 SFT、推理 RL、拒绝采样 SFT、全场景 RL 四阶段完整拆解
- DeepSeek-R1的训练流程强化学习(RL)阶段采用了GRPO算法:GRPO 组内相对奖励、KL 约束、与 PPO 的对比,及 AIME 2024 等基准的性能提升数据
- DeepSeek-V3 高效训练关键技术分析:MLA、DeepSeekMoE、无辅助损失负载均衡、MTP 多令牌预测、FP8 低精度训练等高效训练技术
- DeepSeek-R1 技术全景解析:从原理到实践的"炼金术配方":V3、R1-Zero、R1 三大模型的定位差异与训练关系图解
- DeepSeek技术解读:从V3到R1的MoE架构创新:MoE 架构演进视角下的技术脉络
参考资料与事实边界说明
本文主体内容整理自腾讯新闻《DeepSeek华丽文风从何而来?业内人士:训练数据、训练策略和迭代优化缺一不可》一文(采访对象包括上海交通大学副教授赵波、耶鲁大学助理教授杨卓然、北京邮电大学副教授白婷,以及 DeepSeek 研究员陈德里),并结合仓库内《DeepSeek-R1的四个训练阶段》《DeepSeek-R1的训练流程强化学习(RL)阶段采用了GRPO算法》《DeepSeek-V3 高效训练关键技术分析》等文档进行交叉印证。文中涉及 AIME 2024 成绩、代码可运行率等具体指标均出自仓库姊妹文档所述的技术报告转述,如需确认原始数据,请以 DeepSeek 官方技术报告为准。有关"最强""最佳"等未经技术报告直接证实的表述,本文一律不作结论性使用。
- 文档
- 教程
- 知识库
- 人工智能
【免费下载链接】ai-guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站
相关推荐
如何7天打造你的JavaScript驱动超可爱机器人:Stack-Chan完整指南
如何7天打造你的JavaScript驱动超可爱机器人:Stack Chan完整指南 你是否想过拥有一个会眨眼、会说话、能追踪人脸的超可爱桌面机器人伙伴?Stac
嵌入式物联网智能硬件机器人硬件开发前端AI 应用Qwen-VL模型训练:分布式训练策略与参数调优
Qwen VL模型训练:分布式训练策略与参数调优 引言:大模型训练的核心挑战 在视觉语言(Vision Language, VL)模型领域,Qwen VL(通义
大模型多模态人工智能微调模型推理服务Qwen如何快速掌握鸣潮自动化工具:ok-ww终极指南
如何快速掌握鸣潮自动化工具:ok ww终极指南 鸣潮自动化工具ok ww是一款专为《鸣潮》玩家设计的开源自动化辅助程序,通过先进的图像识别技术实现后台自动战斗、
GUI 自动化计算机视觉RPA人工智能
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考