- 后端
- 文档
- 教程
【免费下载链接】system-design-101
Explain complex systems using visuals and simple terms. Help you prepare for system design interviews.
本指南基于 system-design-101 仓库的 ChatGPT 工作原理 一文展开,用可视化与简单术语拆解 ChatGPT 的完整运行机制。读完本文,你将掌握 ChatGPT 从「互联网语料预训练」到「人类反馈微调」再到「线上问答全流程」的两阶段训练管线与七步推理链路,并能从系统设计的角度理解内容审核、模板响应等安全组件为何必不可少。
说明:OpenAI 并未公开全部实现细节,仓库原文也指出「diagram 中部分细节可能不完全准确」。因此本文基于仓库文档描述的原理框架进行展开,涉及具体数字与内部实现的部分均以「推测 / 业界通用做法」表述,而非未经证实的事实。
总览:ChatGPT 的工作可以拆成两大部分
正如 原文档 所述,ChatGPT 的完整工作流程可以拆分为两个部分:
- 训练(Training):把一个大语言模型从「会补全句子」训练成「会回答问题」的对话助手;
- 推理(Answer a Prompt):用户输入问题后,模型结合内容审核组件安全地生成回答。
这两个部分分别对应了机器学习的「模型构建期」与「服务运行期」,也是系统设计面试中常被考察的 AI 应用分层。下文先讲训练,再讲推理。
第一部分:训练——两个阶段,把补全器变成问答助手
训练 ChatGPT 模型需要经历两个阶段:预训练(Pre-training)与微调(Fine-tuning)。
阶段一:预训练——在互联网语料上学会「续写」
在预训练阶段,我们训练一个GPT 模型(decoder-only transformer,仅解码器 Transformer),输入是海量的互联网文本数据。训练目标是让模型学会:给定一个句子,预测接下来最可能出现的词,并且预测结果在语法正确性和语义合理性上都接近互联网数据本身的分布。
- 模型架构:decoder-only transformer。Transformer 架构(源自 2017 年论文《Attention Is All You Need》)通过自注意力机制与并行化大幅缩短训练时间,是生成式 AI 的基础,这一点在仓库的 ChatGPT 时间线 中也有对应描述。
- 训练目标:自回归式的「下一个词预测(next-token prediction)」。模型每次只看到前文,预测下一个 token,再与真实的下一个 token 计算交叉熵损失并反向传播更新参数。
- 阶段产物:经过预训练后,模型已经具备很强的续写能力——给定任意半句话,它能补出语法通顺、语义合理的后续内容。但它还不能回答问题:你问它一个问题,它只会顺着问题「接着写」,而不是给你一个答案。
这是预训练与微调之间最关键的能力鸿沟:预训练解决「懂语言」,微调解决「懂对话」。
阶段二:微调——三步把模型变成问答助手
微调阶段是一个 3 步流程(对应 OpenAI 在 InstructGPT 论文中提出的 InstructGPT 路线),把预训练模型改造成能回答问题的 ChatGPT 模型:
第 1 步:收集「问题-答案」数据做监督微调(SFT)
收集大量(问题,答案)训练数据,用这些数据对预训练模型做监督式微调。模型以问题为输入,学习生成与训练数据中答案相似的回答。这一步的本质是模仿学习:让模型学会「面对提问时应该输出答案而不是继续追问」。
第 2 步:训练奖励模型(Reward Model)来给回答打分
收集更多数据:对同一个问题收集多个候选答案,并由人工(或规则)将这些答案从最相关到最不相关排序。用这些排序数据训练一个奖励模型(reward model),让它学会预测「哪个回答更好」。奖励模型不是生成器,而是一个打分器——它给任意「问题 + 回答」组合输出一个标量分数,分数越高表示回答质量越高。
第 3 步:用强化学习(PPO)优化模型回答的准确性
使用强化学习(具体算法为PPO,Proximal Policy Optimization,近端策略优化)继续微调模型。流程是:让策略模型针对某个问题生成回答 → 奖励模型对这个回答打分 → 用 PPO 更新策略模型参数,使模型学会生成更容易获得高分的回答。反复迭代后,模型的回答在相关性、准确性、符合人类偏好等方面持续提升。
这 3 步组合起来,就是业界常说的RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的标准配方:SFT 对齐对话形式,奖励模型对齐人类偏好,PPO 把偏好固化成策略。
训练阶段的仓库佐证:这一路线在开源生态中的位置
仓库中 DeepSeek 一页纸 对这条技术路线的变体做了很好的注脚:多数 AI 模型采用监督微调(模仿大量人工标注示例),但这种方式有局限;DeepSeek R1 改用 GRPO(Group Relative Policy Optimization)这类强化学习技术,通过在同一上下文内比较多个候选答案来提升推理效率。这说明「预训练 → 微调 → 强化学习」是当前大模型训练的主流范式,而具体算法仍在快速演进。如果你想搭建自己的对话模型,仓库的 开源 AI 技术栈 一文列出了从模型访问(Ollama、HuggingFace)、后端框架(FastAPI、Langchain)到向量检索(Milvus、FAISS、PGVector)的完整开源工具链,可以直接对照这条训练管线落地。
第二部分:推理——用户提问后的完整链路
训练完成后,模型进入线上服务。仓库原文把「回答一个 prompt」拆成了 7 个步骤,核心特征是内容审核组件贯穿输入与输出两侧:
完整 7 步流程
Step 1:用户输入完整问题
用户输入完整问题,例如:「Explain how a classification algorithm works」(解释分类算法是如何工作的)。这个例子特意选了一个「问法完整、语义清晰」的问题,便于模型理解意图。
Step 2:问题先经过内容审核组件
问题首先被发送到内容审核(content moderation)组件。该组件确保输入问题不违反安全准则,并过滤掉不当问题(如违法、暴力、仇恨言论、隐私侵犯等)。
Step 3-4:按审核结果分流
- 如果输入通过了内容审核,问题被发送到ChatGPT 模型,进入正常的模型推理;
- 如果输入未通过内容审核,则直接进入模板响应生成(template response generation),即返回一条预设的安全模板回答(例如「抱歉,我无法回答这个问题」),不再调用模型。
Step 5-6:模型输出再次经过内容审核
模型生成回答后,输出再次被发送到内容审核组件。这一次审核确保生成的回答是安全(safe)、无害(harmless)、无偏见(unbiased)的——即使问题本身合规,模型也可能生成越界内容,所以输出侧审核不可省略。
Step 7:按审核结果返回用户
- 如果模型输出通过了内容审核,回答被展示给用户;
- 如果未通过,则走模板响应生成,向用户展示一条预设的模板回答。
双向审核的工程意义
从系统设计角度看,这个 7 步流程最值得注意的点是审核发生在两个方向:
- 输入审核(Input Moderation):成本低、拦截早。把明显违规的请求挡在模型推理之前,既保护用户,又节省 GPU 推理算力。
- 输出审核(Output Moderation):防御「越狱 / 对抗性提示」导致的模型输出失控。因为恶意输入可能伪装成合规请求,只有对输出再做一次独立检查,才能保证最终呈现给用户的内容安全。
推理阶段的仓库佐证:从「生成」到「使用」的完整 AI 应用形态
仓库的 什么是 AI Agent 一文展示了这条推理链路如何被进一步封装:AI Agent 是能够感知环境、自主决策并调用工具(访问互联网、代码解释器、API 调用)完成目标的软件程序,其信息处理与决策功能正是由一个 LLM 承担。也就是说,「输入审核 → 模型生成 → 输出审核」这条 ChatGPT 推理链路,是所有基于 LLM 的应用(包括 AI Agent、RAG 问答系统)的公共底座。
常见误区与面试要点
- 「ChatGPT 是搜索引擎」是误解:它的推理链路里没有检索数据库,答案完全由模型按概率生成。内容审核组件负责安全,但不会「查资料」。
- 预训练模型 ≠ 对话模型:仅预训练的模型只会续写,不会问答——这是区分「GPT 基础模型」与「ChatGPT 对话模型」的关键分界。
- 微调不止一步:SFT + 奖励模型 + PPO 三者缺一不可,奖励模型解决「怎么算好」,PPO 解决「怎么做到好」。
- 审核是双向的:只审核输入不审核输出,无法防御模型自身的失控生成;只审核输出不审核输入,则浪费推理算力。
- 算法仍在演进:PPO 并非唯一选择,仓库的 DeepSeek 一页纸 提到的 GRPO 等新方法正在改变微调阶段的成本与效果。
相关阅读
- ChatGPT 时间线:从 1950 年代规则模型、CNN/RNN/GAN 到 2017 年 Transformer 的演进脉络,理解 ChatGPT 为何「突然」出现;
- 开源 AI 技术栈:构建对话类 AI 应用的完整开源工具链选型;
- 什么是 AI Agent:LLM 推理链路如何被封装为可自主行动的 Agent;
- DeepSeek 一页纸:监督微调局限性与 GRPO 强化学习新路线的对比。
- 后端
- 文档
- 教程
【免费下载链接】system-design-101
Explain complex systems using visuals and simple terms. Help you prepare for system design interviews.
相关推荐
lllyasviel/Annotators模型训练:从预训练到微调的完整指南
lllyasviel/Annotators模型训练:从预训练到微调的完整指南 引言:为什么需要专业的模型训练指南? 在计算机视觉和深度学习领域,模型训练是一个复
人工智能计算机视觉深度学习ERNIEKit工具链:从预训练到微调的全流程开发
ERNIEKit工具链:从预训练到微调的全流程开发 ERNIEKit是百度基于PaddlePaddle框架开发的专业大模型训练工具链,专门为ERNIE系列大模型
大模型深度学习一条命令跑通CyberPII-Bench:PII脱敏评估上手手册
一条命令跑通CyberPII Bench:PII脱敏评估上手手册 场景切入 如果你的 AI 智能体把客户邮箱、内网 IP 原样写进了给客户的渗透测试报告,问题就
人工智能AI Agent网络安全渗透测试工具调用AI 评测
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考