1、简述
大模型(基础模型 Foundation Model)分类采用多维度正交划分,不同维度可交叉组合定位模型;分为技术底层维度、数据模态维度、规模算力维度、训练范式维度、应用层级维度、部署形态维度、开源版权维度、任务能力维度八大体系,覆盖学术、工程、产业落地全场景。
2、按底层神经网络架构(技术底层,最核心学术分类)
全部基于 Transformer 衍生,分 4 大类,决定模型能力边界:
2.1 Encoder-only 仅编码器(双向理解型)
- 原理:双向注意力,MLM 掩码预训练,同时读取上下文左右信息
- 优势:文本理解、语义匹配、分类、抽取精度极高
- 短板:不擅长长文本生成
- 适用:检索、情感分析、NER、文本打分、知识库向量
- 代表:BERT、RoBERTa、ERNIE-Base、SimBERT
2.2 Decoder-only 仅解码器(自回归生成,当前主流 LLM)
- 原理:单向从左到右逐 Token 预测,CLM 因果语言建模
- 优势:开放式长文本生成、对话、逻辑推理、代码写作
- 适用:聊天机器人、文案、代码、报告、思维链推理
- 代表:GPT 全系列、Llama3/4、Qwen2/3、GLM、Mistral、DeepSeek
2.3 Encoder-Decoder 编解码(序列转换专用)
- 原理:编码器理解输入,解码器独立生成输出
- 优势:翻译、摘要、改写、短序列转换
- 短板:超长自由生成弱于纯 Decoder
- 代表:T5、BART、ChatGLM 初代、mT5
2.4 MoE 混合专家稀疏架构(超大参数量旗舰架构)
- 原理:总参巨大,但每次推理仅激活少量专家模块,算力可控
- 分类:MoE-Decoder、MoE-Encoder-Decoder、MoE 多模态
- 优势:万亿级参数、强通用能力、训练成本低于稠密大模型
- 代表:GPT-4、Qwen3-Max、Gemini Ultra、Mixtral 8x7B
2.5 补充:非 Transformer 传统大模型(边缘小众)
CNN 视觉大模型(ViT 变体)、RNN 系模型(已淘汰)
3、按输入输出模态(产业最常用分类)
3.1 单模态大模型(仅一类数据)
- LLM 纯文本大语言模型输入输出均为文字;擅长逻辑、数学、文书、代码通用对话;代表:GPT-3.5、Llama3、通义千问基础版
- Code-LLM 代码专用大模型文本子集,海量代码语料专项训练;代码补全、漏洞检测、跨语言转换、工程注释;代表:CodeLlama、DeepSeek-Coder、StarCoder
- 视觉大模型 LVM仅图像输入输出:图像分类、分割、检测;代表:ViT、SAM、Stable Diffusion(纯视觉生成)
- 音频大模型 LAM语音识别、语音合成、音乐生成;代表:Whisper、AudioLDM
- 视频单模态模型短视频生成、动作识别;代表:Sora、可灵、Veo
3.2 多模态大模型 MLLM(Any-to-Any 跨模态融合)
统一语义空间,同时处理文本 / 图像 / 音频 / 视频 / 3D / 文档:
- 多模态理解型:图文问答、图表解析、视频摘要、OCR 文档分析;代表:GPT-4V、Qwen-VL、LLaVA
- 多模态生成型:文生图、文生视频、图文转音频、3D 生成;代表:GPT-4o、Gemini Omni、Sora、万相、Seedance
- 全模态 Omni 模型:实时语音对话 + 视觉 + 视频一体化,端到端音视频交互
4、按参数规模(算力 / 部署分级,工程落地核心)
以稠密模型标准划分,MoE 标注激活参数而非总参数:
| 分级 | 参数量区间 | 部署场景 | 典型代表 |
|---|---|---|---|
| 超轻量端侧模型 | <1B | 手机、IoT、嵌入式、离线本地 | Qwen2-0.5B、Phi-3-mini、Gemma-2B |
| 轻量模型 | 1B~10B | 边缘服务器、个人 PC、低成本私有化 | ChatGLM3-6B、Mistral-7B、Baichuan2-7B |
| 中型模型 | 10B~70B | 企业私有化、API 轻量化服务 | Llama3-13B/70B、Qwen2-14B、DeepSeek-67B |
| 大型稠密模型 | 70B~400B | 云端旗舰、高推理需求场景 | Llama3-400B、Claude 3 Sonnet |
| 超大规模 MoE 模型 | 总参≥1T,激活 10B~200B | 公有云顶级通用模型 | GPT-4、Gemini Ultra、Qwen3-Max |
5、按训练迭代阶段(模型成熟度分类)
完整训练流水线 4 级递进:
- 预训练底座模型(Base Model)仅通用海量数据预训练,无指令、无人类对齐;输出自由、无格式约束,不适合直接对话;多用于二次微调
- 指令微调模型(SFT Supervised Fine-tune)加入指令数据集,学会遵循用户指令、结构化输出;可直接做基础对话、工具调用
- 人类对齐模型(RLHF/DPO)人类反馈强化学习 / 直接偏好优化;安全、价值观对齐、降低幻觉、输出符合人类习惯;市面商用对话模型主流形态(ChatGPT、Claude、文心一言)
- 工具增强基座(Agent 大模型)内置工具调用、函数调用、检索增强能力,可联网、调用插件、操作数据库、控制机器人
6、按应用层级(L0/L1/L2 三层产业分层)
L0:通用基础大模型(通用底座)
无行业偏向,覆盖全领域通用知识,具备通用推理、创作、理解能力;是所有垂直模型的底层底座
- 闭源:GPT-4o、Claude 3、Gemini、文心一言、通义千问
- 开源:Llama3、Qwen3、GLM4、DeepSeek-V3
L1:行业大模型(单行业通用)
基于 L0 底座,注入全行业通用数据,覆盖行业全场景;不局限单一细分任务
- 金融大模型、医疗大模型、法律大模型、工业制造大模型、教育大模型、自动驾驶大模型
L2:垂直场景专用模型(细分任务专用)
在行业模型基础上针对单一细分任务专项训练,精度最高、泛化最弱
- 法律:合同审查模型、裁判文书生成模型
- 医疗:CT 影像诊断、药品研发分子模型 AlphaFold2
- 工业:质检视觉大模型、设备故障预测模型
- 办公:PPT 生成、OCR 文档解析、代码审计专用模型
7、按部署运行形态(运维选型分类)
- 云端 SaaS 模型:厂商 API 调用,无需本地算力,开箱即用(GPT、通义千问公有云)
- 私有化本地部署模型:企业机房服务器部署,数据不出内网(开源 7B/13B/70B 系列)
- 端侧离线模型:手机、平板、边缘硬件本地运行,无网络依赖(<10B 轻量模型)
- 混合部署模型:轻量端侧做基础交互,云端大模型处理复杂推理
8、按开源 / 版权授权(生态分类)
- 闭源商用模型:权重不开放,仅开放 API,无法本地微调;OpenAI GPT、Anthropic Claude。
- 完全开源模型:权重、训练代码全开放,商用无限制;Qwen 全系列、DeepSeek。
- 受限开源模型:权重开放,商用有营收 / 规模限制;Llama3(Meta 商用许可)、Gemma。
- 学术开源模型:仅限科研,禁止商用;LLaVA、早期 BERT 变体。
9、按任务能力范式(功能分类)
1. 判别 / 理解型模型
输入数据做分类、打分、抽取、检索,不生成全新内容;BERT、向量检索模型、风险判别模型
2. 生成式模型(AIGC 核心)
输出全新文本 / 图像 / 音视频 / 代码;GPT、Sora、Stable Diffusion、CodeLlama
3. 推理数学专用模型
强化数理逻辑、符号计算、复杂数学证明;DeepSeek-Math、Qwen-Math、Numina
4. 检索增强 RAG 模型
底座 + 外挂知识库,解决实时信息、私有数据、幻觉问题;企业知识库问答系统专用
5. 机器人 / 具身智能大模型
文本视觉 + 机器人动作控制,物理世界交互;Google Robotics Transformer、特斯拉 FSD 大模型
6. 科学计算基础模型
面向科研:蛋白质结构、气象预测、流体仿真、量子计算;AlphaFold2、风乌气象大模型
10、极简分层总览
底层架构 → 模态输入 → 参数规模 → 训练阶段 → 应用层级 → 部署方式 → 开源属性 → 任务功能。