news 2026/10/5 2:26:48

玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪

玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪

💡这两年只要跟技术沾边的场合,"大模型"三个字几乎绕不过去。DeepSeek、通义千问、GPT、Gemini、Claude……名字一个比一个响,宣传口径也大同小异:参数很大、能力很强、什么都懂一点。

但真要把这些东西讲清楚,很多人会卡在几个很基础的问题上:所谓"7B"“36T token”“5 PFLOPS"到底在说什么?为什么有的模型能看图,有的只能写字?同样是"开源”,为什么有人说开源模型免费,有人说自己部署一台机器比 API 贵得多?

这篇文章就是把大模型的地基先摊平:定义、出现原因、计量单位、分类方式、开源与闭源。后面几篇再往上盖训练、算力和工程落地。


1. 大模型到底是什么

目前学界和工业界对"大模型(Large Models)"并没有一个统一的标准定义。

通常的说法是:训练数据庞大、参数规模巨大、能力强大的深度神经网络模型。参数量一般在10 亿以上,目前顶尖模型的参数规模已经到了万亿级别。

下面这张图是几个大家熟悉模型的公开口径,感受一下量级差异:

简单理解:

传统模型 --> 千万级参数 + 人工标注的几十万条样本 大模型 --> 百亿~万亿级参数 + 万亿级 token 的无标注语料

关键不在"大",而在大到一定程度之后,能力开始出现质的变化——这也是为什么同一个 Transformer 结构,规模上去之后突然会写代码、会做推理。


2. 为什么偏偏是这个时间点出现?

大模型的出现不是偶然,而是数据、算力、模型架构三者协同演进的结果。少任何一条,都到不了今天。

2.1 数据够多:训练范式换了

传统监督学习高度依赖人工标注数据(对原始数据做标记、分类、注释、结构化,让机器能识别理解),成本高、规模上不去。常见的标注活儿长这样:

标注类型干什么
分类标注给整张图打类别标签,比如"猫"“狗”
命名实体识别标出文本里的人名、地名、组织名
情感分析标正面 / 负面 / 中性
语音转写把语音逐句转成文字

大模型主要用自监督学习范式(典型任务是"预测下一个 token"),直接拿海量未标注文本和多模态数据训练。

自监督本质上属于无监督学习的一种特殊形式,但用了监督学习的训练方式:靠数据自身的内在结构自动生成伪标签,再像监督那样训练,不依赖人工标注。掩码语言建模就是典型例子。

量级差别有多大?Qwen3 预训练阶段用了约36T个 token 的语料,这个规模远超传统机器学习时代的训练数据总量。

2.2 算力够强:并行硬件 + 分布式训练成熟

深度学习的训练本质是大规模矩阵运算,这类计算高度并行,和 GPU/TPU 的硬件架构天然契合。

单卡算力方面,英伟达 最新一代B200在FP16(半精度浮点数)条件下峰值算力已达5 PFLOPS(约每秒 5×10¹⁵ 次浮点运算;单位换算1 P = 10 3 T = 10 6 G = 10 9 M = 10 12 K = 10 15 1P=10^{3}T=10^{6}G=10^{9}M=10^{12}K=10^{15}1P=103T=106G=109M=1012K=1015)。

与此同时,三种分布式训练体系已经成熟,让"跨节点、跨集群训练超大规模参数模型"变成现实:

数据并行:每张卡都放完整模型副本,各自处理不同数据子集,靠梯度聚合把参数更新同步 张量并行:把权重矩阵按维度切开,每张卡只算自己那一片,再用集合通信把结果拼起来 流水线并行:按层或模块切成若干阶段,每个阶段放不同设备,数据像流水线一样依次穿过

2.3 架构合理:Transformer 的可扩展性

Transformer 架构天生支持并行计算,并且在模型规模、数据规模、训练步数(算力开销)三个方向同时加大时,性能收益是稳定的——也就是所谓的良好可扩展性(Scaling Law)。

图中 Test Loss 是损失函数的取值。补一个概念:

损失函数(Loss Function)用来量化模型预测值与真实值之间的差异,也叫代价函数或目标函数。它通过计算预测错误程度来评估模型性能,值越小越准,值越大误差越大。常见的有均方误差(MSE)、平均绝对误差(MAE)。

2.4 一句话总结

数据规模的跃迁 + 算力基础设施的发展 + Transformer 优异的可扩展性,三者叠加推动模型规模和性能持续膨胀,这才有了"大模型时代"。


3. 三个计量维度:B、token、FLOPs 分别在说什么

聊大模型最容易搞混的就是单位。其实从三个维度看就清楚了:参数规模、训练数据集规模、计算规模。

维度衡量什么常用单位举例
参数规模模型有多大B(Billion,10 亿,10 9 10^9109)7B = 70 亿参数
训练数据集规模喂了多少文本token 数(B / T)1T token =10 12 10^{12}1012token
计算规模训练烧了多少算力FLOPs(浮点运算次数)1 PFLOPs =10 15 10^{15}1015FLOPs

1)参数规模

这里说的参数,是深度神经网络里"神经元数量、层数、神经元权重、神经元偏移量、超参数"这些数据的集合。

2)训练数据集规模

LLM 的训练在文本语料上进行,而语料处理的第一步就是分词成一系列 token,所以业界习惯用token 数量来衡量训练数据集规模。

多模态模型的数据集格式五花八门,无法用统一单位度量,这块一般不放在一起讨论。

关于 token,很多人第一次接触会懵,这里单独说一下:

Q1:token 到底是什么?

token 是计算机理解人类语言的基础单位。它不一定等于一个词:

  • 可能是一个完整英文单词,也可能是半个、甚至三分之一个
  • 可能是一个中文词,也可能就是一个汉字

大模型在正式开训之前,要先训练一个tokenizer模型,专门负责把所有文本切成 token。粗略的经验值:

1 个英文字符 ≈ 0.3 个 token 1 个中文字符 ≈ 0.6 个 token

想验证的话可以直接用官方的分词器试:https://platform.openai.com/tokenizer

Q2:FLOPs 和 FLOPS 是一回事吗?

不是。课件里的用法区分是:FLOPs(Floating Point Operations)指浮点运算次数,衡量训练消耗的总计算量;而硬件指标里的FLOPS(Per Second)指每秒能完成多少次,衡量的是速度。一个是总量,一个是速率。


4. 大模型怎么分类

两个最常用的切分标准:按模态(输入输出的数据类型)和按功能/输出形态(模型吐出来的是文字、向量还是分数)。

分类标准类别示例
按模态大语言模型Qwen3 / DeepSeek-V3 / GPT-5 语言模块
多模态理解模型Qwen3-VL / GPT-5 / Gemini-3
多模态生成模型Stable Diffusion / DALL·E / Nano-Banana
按功能生成式大模型GPT-5 / DeepSeek-V3 / Qwen3
嵌入模型BGE / E5 / GTE
重排序模型BGE-Reranker / ms-marco-MiniLM
分类模型通常是微调过的小尺寸模型

4.1 按模态分:语言 / 多模态理解 / 多模态生成

先补一个基础概念:

模态(Modality)指的是人或机器感知世界的方式,常见的有文本、图像、音频/语音、视频等。

类型 1:大语言模型(LLM)

又叫语言/文本大模型,专门处理文本数据。

项目说明
输入 → 输出文本 → 文本(token 序列)
技术架构Transformer 文本编码
典型应用对话、写作、推理、翻译、代码生成
代表Qwen3 系列、DeepSeek-V3.2 系列、GPT-5 系列(语言模块)、Gemini-3 系列(语言模块)

需要注意一点:ChatGPT 和 Gemini 本身不属于上面任何单一类别。它们是以语言大模型为中枢的智能体系统,是面向用户推出的 AI 产品,支持文本生成、图像理解和图像生成。模型 ≠ 产品,这个区分后面讲工程落地时还会反复遇到。

类型 2:多模态理解大模型

能同时处理和理解多种类型的数据(文本、图像、音频、视频),通过对比学习等技术把不同模态映射到统一语义空间。

项目说明
输入 → 输出文本 + 图像/音频/视频 → 通常是文本
技术架构多编码器 + 跨模态融合
典型应用看图说话(VQA)、视频理解、音频理解、文档理解(PDF / 表格 / 图像)
代表GPT-5 系列、Qwen3-VL 系列、Gemini-3 系列

类型 3:多模态生成模型

不光能理解多种模态,还能做跨模态内容生成。核心是生成式架构,靠扩散模型、自回归生成等技术完成从一种模态到另一种模态的转换。

项目说明
输入 → 输出文本/图像 → 图像/视频/音频
技术架构生成式架构(扩散 / 自回归)
典型应用文生图、文/图生视频、文生音频(TTS / Music)
代表图像:Stable Diffusion、DALL·E、GPT-Image-1.5、Nano-Banana;视频:Sora、Veo;音频:AudioLM、VALL-E

4.2 按功能/输出形态分:生成 / 嵌入 / 重排序 / 分类

类型 1:生成式大模型(Generative LLM)

根据指令或提示,从无到有生成原创内容(文本、图像、音频、视频)。

  • 输出:token 序列
  • 优化目标:最大化条件概率 P(token | context)
  • 核心特征:自回归(Autoregressive)生成——不断预测下一个 token 来产出内容
  • 典型应用:对话、推理、Agent、RAG 的最终回答生成
  • 代表:GPT-5、DeepSeek-V3、Qwen3,以及 DALL·E(图像)、Sora(视频)

类型 2:嵌入模型 / 向量表征模型(Embedding Model)

把文本、图像等离散数据转换成高维向量,在向量空间里捕捉语义关系。语义相似的文本在向量空间中距离更近,因此便于快速检索和比较。

  • 输出:固定维度的稠密向量(dense vector),不生成文本
  • 典型应用:语义搜索、推荐系统、知识库检索、文档相似度计算
  • 代表:BGE 系列、E5 系列、GTE 系列

类型 3:重排序 / 相关性打分模型(Reranking)

对初步检索出来的结果做精细化排序:通过深度语义分析重新计算查询与文档的相关性得分,把最相关的顶到前面。

  • 输入:(query, doc) 一对 →输出:相关性分数(scalar)
  • 典型应用:RAG 系统的检索结果优化、搜索引擎排序、推荐系统精排
  • 代表:BGE-Reranker 系列、Hugging Face 上 Cross-Encoder 组织的 ms-marco-MiniLM 系列(Cross-Encoder 是个在 Hugging Face 上训练了很多 Text Reranking 模型的组织)

类型 4:分类器 / 判别模型(Classifier)

根据数据特征预测其所属的预定义类别,输出离散的类别标签或概率分布。

  • 输出:标签 / 概率 / Yes-No
  • 典型应用:垃圾邮件识别、情感分析、图像分类、疾病诊断等二分类或多分类任务
  • 代表:通常是微调过的小模型,比如基于 BERT 微调的分类模型

四者横向对比:

维度生成式大模型嵌入模型重排序模型分类模型
核心任务内容生成语义编码相关性排序类别预测
输出形式自然语言/图像/音频高维向量相关性分数类别标签
模型规模百亿~千亿参数百万~亿级参数千万~亿级参数百万~千万参数
计算成本极高极低中低低
典型架构Transformer 解码器Transformer 编码器交叉编码器逻辑回归/SVM/决策树

4.3 这四类模型不是竞争关系,是流水线

这一块是很多人第一次看会漏掉的重点:实际系统里四类模型往往协同工作,尤其是 RAG 场景。

知识库文档 --> 嵌入模型编码成向量 --> 存入向量数据库 ↓ 用户提问 --> 嵌入模型检索候选文档 --> 重排序模型精排 --> 分类模型过滤/判定 --> 生成式大模型输出答案

检索(Embedding + Rerank)负责"找得准",生成(LLM)负责"说得清"。这种组合正是 RAG 的标准形态。


5. 开源 vs 闭源:差别不只是"要不要钱"

5.1 先拆四要素

一个大模型由四个要素构成:模型权重(参数)、推理代码、训练代码、训练数据集。

四者层次一旦理清,就会发现"开源"这个词的含金量差别很大。

需要注意的是,大模型的开源和传统软件的开源不是一回事。这里要特别拎一个概念出来:

严格来说,业界大量所谓"开源大模型",更准确的叫法其实是Open Weight(开放权重模型)。

权重开放 ≠ 推理代码开放 ≠ 训练代码开放 ≠ 训练数据开放 ≠ 可自由商用

这几件事完全不是一回事。大模型开源通常只开放权重,可能附带推理代码,但一般不包含训练代码和数据集。如果涉及企业商业化或私有部署,License 一定要单独检查。

阵营含义典型代表
开源 / 开放权重主要指开放权重(模型参数),任何人可查看、修改、分发DeepSeek 系列、Qwen 系列、Llama 系列、文心大模型 4.5
闭源特定企业开发并保密,源代码和内部实现不对外公开GPT 系列(早期 GPT-1/GPT-2 和后来开源的 GPT-OSS 系列除外)、Gemini 系列(大多数)、Claude 系列

5.2 七个维度的正面对比

维度开源大模型闭源大模型
透明度代码和算法完全透明,可审查验证内部机制不透明,存在"黑箱"问题
可访问性免费使用,降低技术门槛需要特定许可或授权,通常付费
定制性支持深度定制和优化定制能力受限,仅限 API 参数调整
创新速度社区协作推动快速迭代依赖单一团队,创新速度较慢
成本结构免费使用,但需硬件和运维投入按使用量付费,前期投入低但长期成本高
技术支持依赖社区,缺乏官方专业支持提供企业级技术支持和维护服务
安全性透明可审计,但可能被恶意利用代码不公开,保护知识产权和用户数据
Q:开源不是免费吗,为什么常说自建比调 API 贵?

关键就在成本结构这一行。开源免掉的是"模型授权费",但权重跑起来要卡、要电、要运维,而且推理量小的时候这笔固定投入摊不薄。闭源按 token 付费,前期几乎零投入,但量级一大长期成本会反超。

所以真实分界线通常是调用量和数据能否出内网,不是"开源省钱、闭源贵"这么简单。

5.3 各自的商业逻辑

开源的商业逻辑:技术扩散换取生态影响

  • 核心策略:用"免费厨房"模式吸引开发者,构建庞大用户生态,再通过云服务、工具链、行业解决方案等增值服务盈利
  • 变现路径:云服务变现、企业级定制、硬件生态、工具链和平台
  • 优势:快速占领市场、建立行业标准、降低用户采用门槛,形成"创新飞轮"——企业贡献基础模型,学术界优化算法,开发者创造应用,最终反哺模型迭代

闭源的逻辑:专有技术换取商业利润

  • 核心策略:用技术垄断建立护城河,通过 API 调用、企业级定制方案、云平台集成直接变现
  • 盈利模式:API 订阅服务、企业级解决方案、技术授权和专利变现、云平台增值服务
  • 优势:直接盈利能力强、技术溢价高、服务质量稳定、保护知识产权——在短期激烈竞争中能确实拿到利润

5.4 混合模式已经是主流

随着竞争加剧,"开源引流、闭源变现"成了很多企业的标准打法:

厂商开源的那一半闭源的那一半
谷歌Gemma,吸引开发者生态Gemini,服务高利润企业客户
MetaLlama 系列建生态自研模型用于商业服务
阿里巴巴通义千问,中国最大的开源模型家族闭源企业级服务
百度2025 年 6 月开源文心 4.5 系列闭源 API 服务

这种模式既能靠开源快速立生态,又能靠闭源保住商业回报,目前看是主流解法。


最后总结

  • 什么是大模型:目前没有统一定义,经验线是参数量 10 亿以上、顶尖已到万亿级;真正的价值不在于"大",而在于规模上去之后能力出现跃迁。
  • 为什么是现在:数据(自监督范式解放语料规模)、算力(GPU/TPU + 三种并行成熟)、架构(Transformer 的可扩展性)三条同时到位,缺一条都起不来。
  • 怎么看参数表:B说模型多大,T token说喂了多少,FLOPs说烧了多少算力。三者不要混为一谈。
  • 怎么选模型类型:日常文本用 LLM;要处理图片/视频/音频的理解用多模态理解模型;要产出图像视频用多模态生成模型;做检索则离不开嵌入 + 重排序。
  • 开源还是闭源:真正该关心的是开放到哪一层(权重/推理代码/训练代码/数据),以及自己的调用量和数据合规要求。
  • 对于准备做工程落地的开发者,我个人更建议先记住这一句:模型 ≠ 产品,权重开放 ≠ 自由商用,检索和生成是两类模型在协作。

第二篇会接着讲:这些能力到底是怎么训练出来的——预训练、SFT、RLHF 三阶段各解决了什么问题。

参考资料 & 致谢

[1] 尚硅谷大模型技术之大模型概述 V1.0.3-课件
[2] Transformer 论文 Attention Is All You Need-arXiv
[3] OpenAI Tokenizer-官方工具
[4] Qwen 官网
[5] DeepSeek 官网
[6] NVIDIA 官网
[7] Stability AI 官网
[8] Hugging Face Cross-Encoder Reranker-模型库
[9] Llama 官网
[10] Anthropic 官网

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/5 2:26:02

录音时添加笔记能快速定位对应音频吗

这个问题的核心关键词是录音实时记笔记、音频定位、录音与笔记关联,很多用户在实际使用中遇到过点了笔记跳错时间轴、内容和音频完全对不上的翻车情况。功能基础判定录音实时记笔记,是指录音过程中即可随时添加笔记,听到重点内容、产生新的想…

作者头像 李华
网站建设 2026/10/5 2:24:06

Gin框架Swagger文档自动生成与API管理最佳实践

Gin框架Swagger文档自动生成与API管理最佳实践 导语 API文档是前后端协作的桥梁。手动编写和维护Swagger文档不仅耗时,还容易与代码脱节。通过swaggo/swag工具,可以直接从Gin代码的注释中自动生成OpenAPI 2.0规范的Swagger文档,实现"代码…

作者头像 李华
网站建设 2026/10/5 2:24:03

滑动、自锁、拨码、轻触开关:四种常用开关特性与选型

四种开关完整对比 特性、用途、结构区分一、双档滑动开关(拨动滑动开关)核心特点操作:左右 / 上下拨滑切换 2 个档位,无弹簧回弹,拨到哪停在哪触点:2 路通断,常见单刀双掷 (SPDT)手感&#xff…

作者头像 李华
网站建设 2026/10/5 2:23:51

RimSort 外部数据库体系全解析:配置、获取与 Git 协作管理

桌面应用游戏开发CLI 【免费下载链接】RimSort RimSort is an open source mod manager for the video game RimWorld. There is support for Linux, Mac, and Windows, built from the ground up to be a reliable, community-managed alternative to RimPy Mod Manager. 项目…

作者头像 李华