玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪
💡这两年只要跟技术沾边的场合,"大模型"三个字几乎绕不过去。DeepSeek、通义千问、GPT、Gemini、Claude……名字一个比一个响,宣传口径也大同小异:参数很大、能力很强、什么都懂一点。
但真要把这些东西讲清楚,很多人会卡在几个很基础的问题上:所谓"7B"“36T token”“5 PFLOPS"到底在说什么?为什么有的模型能看图,有的只能写字?同样是"开源”,为什么有人说开源模型免费,有人说自己部署一台机器比 API 贵得多?
这篇文章就是把大模型的地基先摊平:定义、出现原因、计量单位、分类方式、开源与闭源。后面几篇再往上盖训练、算力和工程落地。
1. 大模型到底是什么
目前学界和工业界对"大模型(Large Models)"并没有一个统一的标准定义。
通常的说法是:训练数据庞大、参数规模巨大、能力强大的深度神经网络模型。参数量一般在10 亿以上,目前顶尖模型的参数规模已经到了万亿级别。
下面这张图是几个大家熟悉模型的公开口径,感受一下量级差异:
简单理解:
传统模型 --> 千万级参数 + 人工标注的几十万条样本 大模型 --> 百亿~万亿级参数 + 万亿级 token 的无标注语料关键不在"大",而在大到一定程度之后,能力开始出现质的变化——这也是为什么同一个 Transformer 结构,规模上去之后突然会写代码、会做推理。
2. 为什么偏偏是这个时间点出现?
大模型的出现不是偶然,而是数据、算力、模型架构三者协同演进的结果。少任何一条,都到不了今天。
2.1 数据够多:训练范式换了
传统监督学习高度依赖人工标注数据(对原始数据做标记、分类、注释、结构化,让机器能识别理解),成本高、规模上不去。常见的标注活儿长这样:
| 标注类型 | 干什么 |
|---|---|
| 分类标注 | 给整张图打类别标签,比如"猫"“狗” |
| 命名实体识别 | 标出文本里的人名、地名、组织名 |
| 情感分析 | 标正面 / 负面 / 中性 |
| 语音转写 | 把语音逐句转成文字 |
大模型主要用自监督学习范式(典型任务是"预测下一个 token"),直接拿海量未标注文本和多模态数据训练。
自监督本质上属于无监督学习的一种特殊形式,但用了监督学习的训练方式:靠数据自身的内在结构自动生成伪标签,再像监督那样训练,不依赖人工标注。掩码语言建模就是典型例子。
量级差别有多大?Qwen3 预训练阶段用了约36T个 token 的语料,这个规模远超传统机器学习时代的训练数据总量。
2.2 算力够强:并行硬件 + 分布式训练成熟
深度学习的训练本质是大规模矩阵运算,这类计算高度并行,和 GPU/TPU 的硬件架构天然契合。
单卡算力方面,英伟达 最新一代B200在FP16(半精度浮点数)条件下峰值算力已达5 PFLOPS(约每秒 5×10¹⁵ 次浮点运算;单位换算1 P = 10 3 T = 10 6 G = 10 9 M = 10 12 K = 10 15 1P=10^{3}T=10^{6}G=10^{9}M=10^{12}K=10^{15}1P=103T=106G=109M=1012K=1015)。
与此同时,三种分布式训练体系已经成熟,让"跨节点、跨集群训练超大规模参数模型"变成现实:
数据并行:每张卡都放完整模型副本,各自处理不同数据子集,靠梯度聚合把参数更新同步 张量并行:把权重矩阵按维度切开,每张卡只算自己那一片,再用集合通信把结果拼起来 流水线并行:按层或模块切成若干阶段,每个阶段放不同设备,数据像流水线一样依次穿过2.3 架构合理:Transformer 的可扩展性
Transformer 架构天生支持并行计算,并且在模型规模、数据规模、训练步数(算力开销)三个方向同时加大时,性能收益是稳定的——也就是所谓的良好可扩展性(Scaling Law)。
图中 Test Loss 是损失函数的取值。补一个概念:
损失函数(Loss Function)用来量化模型预测值与真实值之间的差异,也叫代价函数或目标函数。它通过计算预测错误程度来评估模型性能,值越小越准,值越大误差越大。常见的有均方误差(MSE)、平均绝对误差(MAE)。
2.4 一句话总结
数据规模的跃迁 + 算力基础设施的发展 + Transformer 优异的可扩展性,三者叠加推动模型规模和性能持续膨胀,这才有了"大模型时代"。
3. 三个计量维度:B、token、FLOPs 分别在说什么
聊大模型最容易搞混的就是单位。其实从三个维度看就清楚了:参数规模、训练数据集规模、计算规模。
| 维度 | 衡量什么 | 常用单位 | 举例 |
|---|---|---|---|
| 参数规模 | 模型有多大 | B(Billion,10 亿,10 9 10^9109) | 7B = 70 亿参数 |
| 训练数据集规模 | 喂了多少文本 | token 数(B / T) | 1T token =10 12 10^{12}1012token |
| 计算规模 | 训练烧了多少算力 | FLOPs(浮点运算次数) | 1 PFLOPs =10 15 10^{15}1015FLOPs |
1)参数规模
这里说的参数,是深度神经网络里"神经元数量、层数、神经元权重、神经元偏移量、超参数"这些数据的集合。
2)训练数据集规模
LLM 的训练在文本语料上进行,而语料处理的第一步就是分词成一系列 token,所以业界习惯用token 数量来衡量训练数据集规模。
多模态模型的数据集格式五花八门,无法用统一单位度量,这块一般不放在一起讨论。
关于 token,很多人第一次接触会懵,这里单独说一下:
Q1:token 到底是什么?
token 是计算机理解人类语言的基础单位。它不一定等于一个词:
- 可能是一个完整英文单词,也可能是半个、甚至三分之一个
- 可能是一个中文词,也可能就是一个汉字
大模型在正式开训之前,要先训练一个tokenizer模型,专门负责把所有文本切成 token。粗略的经验值:
1 个英文字符 ≈ 0.3 个 token 1 个中文字符 ≈ 0.6 个 token想验证的话可以直接用官方的分词器试:https://platform.openai.com/tokenizer
Q2:FLOPs 和 FLOPS 是一回事吗?
不是。课件里的用法区分是:FLOPs(Floating Point Operations)指浮点运算次数,衡量训练消耗的总计算量;而硬件指标里的FLOPS(Per Second)指每秒能完成多少次,衡量的是速度。一个是总量,一个是速率。
4. 大模型怎么分类
两个最常用的切分标准:按模态(输入输出的数据类型)和按功能/输出形态(模型吐出来的是文字、向量还是分数)。
| 分类标准 | 类别 | 示例 |
|---|---|---|
| 按模态 | 大语言模型 | Qwen3 / DeepSeek-V3 / GPT-5 语言模块 |
| 多模态理解模型 | Qwen3-VL / GPT-5 / Gemini-3 | |
| 多模态生成模型 | Stable Diffusion / DALL·E / Nano-Banana | |
| 按功能 | 生成式大模型 | GPT-5 / DeepSeek-V3 / Qwen3 |
| 嵌入模型 | BGE / E5 / GTE | |
| 重排序模型 | BGE-Reranker / ms-marco-MiniLM | |
| 分类模型 | 通常是微调过的小尺寸模型 |
4.1 按模态分:语言 / 多模态理解 / 多模态生成
先补一个基础概念:
模态(Modality)指的是人或机器感知世界的方式,常见的有文本、图像、音频/语音、视频等。
类型 1:大语言模型(LLM)
又叫语言/文本大模型,专门处理文本数据。
| 项目 | 说明 |
|---|---|
| 输入 → 输出 | 文本 → 文本(token 序列) |
| 技术架构 | Transformer 文本编码 |
| 典型应用 | 对话、写作、推理、翻译、代码生成 |
| 代表 | Qwen3 系列、DeepSeek-V3.2 系列、GPT-5 系列(语言模块)、Gemini-3 系列(语言模块) |
需要注意一点:ChatGPT 和 Gemini 本身不属于上面任何单一类别。它们是以语言大模型为中枢的智能体系统,是面向用户推出的 AI 产品,支持文本生成、图像理解和图像生成。模型 ≠ 产品,这个区分后面讲工程落地时还会反复遇到。
类型 2:多模态理解大模型
能同时处理和理解多种类型的数据(文本、图像、音频、视频),通过对比学习等技术把不同模态映射到统一语义空间。
| 项目 | 说明 |
|---|---|
| 输入 → 输出 | 文本 + 图像/音频/视频 → 通常是文本 |
| 技术架构 | 多编码器 + 跨模态融合 |
| 典型应用 | 看图说话(VQA)、视频理解、音频理解、文档理解(PDF / 表格 / 图像) |
| 代表 | GPT-5 系列、Qwen3-VL 系列、Gemini-3 系列 |
类型 3:多模态生成模型
不光能理解多种模态,还能做跨模态内容生成。核心是生成式架构,靠扩散模型、自回归生成等技术完成从一种模态到另一种模态的转换。
| 项目 | 说明 |
|---|---|
| 输入 → 输出 | 文本/图像 → 图像/视频/音频 |
| 技术架构 | 生成式架构(扩散 / 自回归) |
| 典型应用 | 文生图、文/图生视频、文生音频(TTS / Music) |
| 代表 | 图像:Stable Diffusion、DALL·E、GPT-Image-1.5、Nano-Banana;视频:Sora、Veo;音频:AudioLM、VALL-E |
4.2 按功能/输出形态分:生成 / 嵌入 / 重排序 / 分类
类型 1:生成式大模型(Generative LLM)
根据指令或提示,从无到有生成原创内容(文本、图像、音频、视频)。
- 输出:token 序列
- 优化目标:最大化条件概率 P(token | context)
- 核心特征:自回归(Autoregressive)生成——不断预测下一个 token 来产出内容
- 典型应用:对话、推理、Agent、RAG 的最终回答生成
- 代表:GPT-5、DeepSeek-V3、Qwen3,以及 DALL·E(图像)、Sora(视频)
类型 2:嵌入模型 / 向量表征模型(Embedding Model)
把文本、图像等离散数据转换成高维向量,在向量空间里捕捉语义关系。语义相似的文本在向量空间中距离更近,因此便于快速检索和比较。
- 输出:固定维度的稠密向量(dense vector),不生成文本
- 典型应用:语义搜索、推荐系统、知识库检索、文档相似度计算
- 代表:BGE 系列、E5 系列、GTE 系列
类型 3:重排序 / 相关性打分模型(Reranking)
对初步检索出来的结果做精细化排序:通过深度语义分析重新计算查询与文档的相关性得分,把最相关的顶到前面。
- 输入:(query, doc) 一对 →输出:相关性分数(scalar)
- 典型应用:RAG 系统的检索结果优化、搜索引擎排序、推荐系统精排
- 代表:BGE-Reranker 系列、Hugging Face 上 Cross-Encoder 组织的 ms-marco-MiniLM 系列(Cross-Encoder 是个在 Hugging Face 上训练了很多 Text Reranking 模型的组织)
类型 4:分类器 / 判别模型(Classifier)
根据数据特征预测其所属的预定义类别,输出离散的类别标签或概率分布。
- 输出:标签 / 概率 / Yes-No
- 典型应用:垃圾邮件识别、情感分析、图像分类、疾病诊断等二分类或多分类任务
- 代表:通常是微调过的小模型,比如基于 BERT 微调的分类模型
四者横向对比:
| 维度 | 生成式大模型 | 嵌入模型 | 重排序模型 | 分类模型 |
|---|---|---|---|---|
| 核心任务 | 内容生成 | 语义编码 | 相关性排序 | 类别预测 |
| 输出形式 | 自然语言/图像/音频 | 高维向量 | 相关性分数 | 类别标签 |
| 模型规模 | 百亿~千亿参数 | 百万~亿级参数 | 千万~亿级参数 | 百万~千万参数 |
| 计算成本 | 极高 | 极低 | 中低 | 低 |
| 典型架构 | Transformer 解码器 | Transformer 编码器 | 交叉编码器 | 逻辑回归/SVM/决策树 |
4.3 这四类模型不是竞争关系,是流水线
这一块是很多人第一次看会漏掉的重点:实际系统里四类模型往往协同工作,尤其是 RAG 场景。
知识库文档 --> 嵌入模型编码成向量 --> 存入向量数据库 ↓ 用户提问 --> 嵌入模型检索候选文档 --> 重排序模型精排 --> 分类模型过滤/判定 --> 生成式大模型输出答案检索(Embedding + Rerank)负责"找得准",生成(LLM)负责"说得清"。这种组合正是 RAG 的标准形态。
5. 开源 vs 闭源:差别不只是"要不要钱"
5.1 先拆四要素
一个大模型由四个要素构成:模型权重(参数)、推理代码、训练代码、训练数据集。
四者层次一旦理清,就会发现"开源"这个词的含金量差别很大。
需要注意的是,大模型的开源和传统软件的开源不是一回事。这里要特别拎一个概念出来:
严格来说,业界大量所谓"开源大模型",更准确的叫法其实是Open Weight(开放权重模型)。
权重开放 ≠ 推理代码开放 ≠ 训练代码开放 ≠ 训练数据开放 ≠ 可自由商用这几件事完全不是一回事。大模型开源通常只开放权重,可能附带推理代码,但一般不包含训练代码和数据集。如果涉及企业商业化或私有部署,License 一定要单独检查。
| 阵营 | 含义 | 典型代表 |
|---|---|---|
| 开源 / 开放权重 | 主要指开放权重(模型参数),任何人可查看、修改、分发 | DeepSeek 系列、Qwen 系列、Llama 系列、文心大模型 4.5 |
| 闭源 | 特定企业开发并保密,源代码和内部实现不对外公开 | GPT 系列(早期 GPT-1/GPT-2 和后来开源的 GPT-OSS 系列除外)、Gemini 系列(大多数)、Claude 系列 |
5.2 七个维度的正面对比
| 维度 | 开源大模型 | 闭源大模型 |
|---|---|---|
| 透明度 | 代码和算法完全透明,可审查验证 | 内部机制不透明,存在"黑箱"问题 |
| 可访问性 | 免费使用,降低技术门槛 | 需要特定许可或授权,通常付费 |
| 定制性 | 支持深度定制和优化 | 定制能力受限,仅限 API 参数调整 |
| 创新速度 | 社区协作推动快速迭代 | 依赖单一团队,创新速度较慢 |
| 成本结构 | 免费使用,但需硬件和运维投入 | 按使用量付费,前期投入低但长期成本高 |
| 技术支持 | 依赖社区,缺乏官方专业支持 | 提供企业级技术支持和维护服务 |
| 安全性 | 透明可审计,但可能被恶意利用 | 代码不公开,保护知识产权和用户数据 |
Q:开源不是免费吗,为什么常说自建比调 API 贵?
关键就在成本结构这一行。开源免掉的是"模型授权费",但权重跑起来要卡、要电、要运维,而且推理量小的时候这笔固定投入摊不薄。闭源按 token 付费,前期几乎零投入,但量级一大长期成本会反超。
所以真实分界线通常是调用量和数据能否出内网,不是"开源省钱、闭源贵"这么简单。
5.3 各自的商业逻辑
开源的商业逻辑:技术扩散换取生态影响
- 核心策略:用"免费厨房"模式吸引开发者,构建庞大用户生态,再通过云服务、工具链、行业解决方案等增值服务盈利
- 变现路径:云服务变现、企业级定制、硬件生态、工具链和平台
- 优势:快速占领市场、建立行业标准、降低用户采用门槛,形成"创新飞轮"——企业贡献基础模型,学术界优化算法,开发者创造应用,最终反哺模型迭代
闭源的逻辑:专有技术换取商业利润
- 核心策略:用技术垄断建立护城河,通过 API 调用、企业级定制方案、云平台集成直接变现
- 盈利模式:API 订阅服务、企业级解决方案、技术授权和专利变现、云平台增值服务
- 优势:直接盈利能力强、技术溢价高、服务质量稳定、保护知识产权——在短期激烈竞争中能确实拿到利润
5.4 混合模式已经是主流
随着竞争加剧,"开源引流、闭源变现"成了很多企业的标准打法:
| 厂商 | 开源的那一半 | 闭源的那一半 |
|---|---|---|
| 谷歌 | Gemma,吸引开发者生态 | Gemini,服务高利润企业客户 |
| Meta | Llama 系列建生态 | 自研模型用于商业服务 |
| 阿里巴巴 | 通义千问,中国最大的开源模型家族 | 闭源企业级服务 |
| 百度 | 2025 年 6 月开源文心 4.5 系列 | 闭源 API 服务 |
这种模式既能靠开源快速立生态,又能靠闭源保住商业回报,目前看是主流解法。
最后总结
- 什么是大模型:目前没有统一定义,经验线是参数量 10 亿以上、顶尖已到万亿级;真正的价值不在于"大",而在于规模上去之后能力出现跃迁。
- 为什么是现在:数据(自监督范式解放语料规模)、算力(GPU/TPU + 三种并行成熟)、架构(Transformer 的可扩展性)三条同时到位,缺一条都起不来。
- 怎么看参数表:
B说模型多大,T token说喂了多少,FLOPs说烧了多少算力。三者不要混为一谈。 - 怎么选模型类型:日常文本用 LLM;要处理图片/视频/音频的理解用多模态理解模型;要产出图像视频用多模态生成模型;做检索则离不开嵌入 + 重排序。
- 开源还是闭源:真正该关心的是开放到哪一层(权重/推理代码/训练代码/数据),以及自己的调用量和数据合规要求。
- 对于准备做工程落地的开发者,我个人更建议先记住这一句:模型 ≠ 产品,权重开放 ≠ 自由商用,检索和生成是两类模型在协作。
第二篇会接着讲:这些能力到底是怎么训练出来的——预训练、SFT、RLHF 三阶段各解决了什么问题。
参考资料 & 致谢
[1] 尚硅谷大模型技术之大模型概述 V1.0.3-课件
[2] Transformer 论文 Attention Is All You Need-arXiv
[3] OpenAI Tokenizer-官方工具
[4] Qwen 官网
[5] DeepSeek 官网
[6] NVIDIA 官网
[7] Stability AI 官网
[8] Hugging Face Cross-Encoder Reranker-模型库
[9] Llama 官网
[10] Anthropic 官网