news 2026/7/22 9:45:51

大模型分类体系

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
大模型分类体系

1、简述

大模型(基础模型 Foundation Model)分类采用多维度正交划分,不同维度可交叉组合定位模型;分为技术底层维度、数据模态维度、规模算力维度、训练范式维度、应用层级维度、部署形态维度、开源版权维度、任务能力维度八大体系,覆盖学术、工程、产业落地全场景。

2、按底层神经网络架构(技术底层,最核心学术分类)

全部基于 Transformer 衍生,分 4 大类,决定模型能力边界:

2.1 Encoder-only 仅编码器(双向理解型)

  • 原理:双向注意力,MLM 掩码预训练,同时读取上下文左右信息
  • 优势:文本理解、语义匹配、分类、抽取精度极高
  • 短板:不擅长长文本生成
  • 适用:检索、情感分析、NER、文本打分、知识库向量
  • 代表:BERT、RoBERTa、ERNIE-Base、SimBERT

2.2 Decoder-only 仅解码器(自回归生成,当前主流 LLM)

  • 原理:单向从左到右逐 Token 预测,CLM 因果语言建模
  • 优势:开放式长文本生成、对话、逻辑推理、代码写作
  • 适用:聊天机器人、文案、代码、报告、思维链推理
  • 代表:GPT 全系列、Llama3/4、Qwen2/3、GLM、Mistral、DeepSeek

2.3 Encoder-Decoder 编解码(序列转换专用)

  • 原理:编码器理解输入,解码器独立生成输出
  • 优势:翻译、摘要、改写、短序列转换
  • 短板:超长自由生成弱于纯 Decoder
  • 代表:T5、BART、ChatGLM 初代、mT5

2.4 MoE 混合专家稀疏架构(超大参数量旗舰架构)

  • 原理:总参巨大,但每次推理仅激活少量专家模块,算力可控
  • 分类:MoE-Decoder、MoE-Encoder-Decoder、MoE 多模态
  • 优势:万亿级参数、强通用能力、训练成本低于稠密大模型
  • 代表:GPT-4、Qwen3-Max、Gemini Ultra、Mixtral 8x7B

2.5 补充:非 Transformer 传统大模型(边缘小众)

CNN 视觉大模型(ViT 变体)、RNN 系模型(已淘汰)

3、按输入输出模态(产业最常用分类)

3.1 单模态大模型(仅一类数据)

  1. LLM 纯文本大语言模型输入输出均为文字;擅长逻辑、数学、文书、代码通用对话;代表:GPT-3.5、Llama3、通义千问基础版
  2. Code-LLM 代码专用大模型文本子集,海量代码语料专项训练;代码补全、漏洞检测、跨语言转换、工程注释;代表:CodeLlama、DeepSeek-Coder、StarCoder
  3. 视觉大模型 LVM仅图像输入输出:图像分类、分割、检测;代表:ViT、SAM、Stable Diffusion(纯视觉生成)
  4. 音频大模型 LAM语音识别、语音合成、音乐生成;代表:Whisper、AudioLDM
  5. 视频单模态模型短视频生成、动作识别;代表:Sora、可灵、Veo

3.2 多模态大模型 MLLM(Any-to-Any 跨模态融合)

统一语义空间,同时处理文本 / 图像 / 音频 / 视频 / 3D / 文档:

  1. 多模态理解型:图文问答、图表解析、视频摘要、OCR 文档分析;代表:GPT-4V、Qwen-VL、LLaVA
  2. 多模态生成型:文生图、文生视频、图文转音频、3D 生成;代表:GPT-4o、Gemini Omni、Sora、万相、Seedance
  3. 全模态 Omni 模型:实时语音对话 + 视觉 + 视频一体化,端到端音视频交互

4、按参数规模(算力 / 部署分级,工程落地核心)

以稠密模型标准划分,MoE 标注激活参数而非总参数:

分级参数量区间部署场景典型代表
超轻量端侧模型<1B手机、IoT、嵌入式、离线本地Qwen2-0.5B、Phi-3-mini、Gemma-2B
轻量模型1B~10B边缘服务器、个人 PC、低成本私有化ChatGLM3-6B、Mistral-7B、Baichuan2-7B
中型模型10B~70B企业私有化、API 轻量化服务Llama3-13B/70B、Qwen2-14B、DeepSeek-67B
大型稠密模型70B~400B云端旗舰、高推理需求场景Llama3-400B、Claude 3 Sonnet
超大规模 MoE 模型总参≥1T,激活 10B~200B公有云顶级通用模型GPT-4、Gemini Ultra、Qwen3-Max

5、按训练迭代阶段(模型成熟度分类)

完整训练流水线 4 级递进:

  1. 预训练底座模型(Base Model)仅通用海量数据预训练,无指令、无人类对齐;输出自由、无格式约束,不适合直接对话;多用于二次微调
  2. 指令微调模型(SFT Supervised Fine-tune)加入指令数据集,学会遵循用户指令、结构化输出;可直接做基础对话、工具调用
  3. 人类对齐模型(RLHF/DPO)人类反馈强化学习 / 直接偏好优化;安全、价值观对齐、降低幻觉、输出符合人类习惯;市面商用对话模型主流形态(ChatGPT、Claude、文心一言)
  4. 工具增强基座(Agent 大模型)内置工具调用、函数调用、检索增强能力,可联网、调用插件、操作数据库、控制机器人

6、按应用层级(L0/L1/L2 三层产业分层)

L0:通用基础大模型(通用底座)

无行业偏向,覆盖全领域通用知识,具备通用推理、创作、理解能力;是所有垂直模型的底层底座

  • 闭源:GPT-4o、Claude 3、Gemini、文心一言、通义千问
  • 开源:Llama3、Qwen3、GLM4、DeepSeek-V3

L1:行业大模型(单行业通用)

基于 L0 底座,注入全行业通用数据,覆盖行业全场景;不局限单一细分任务

  • 金融大模型、医疗大模型、法律大模型、工业制造大模型、教育大模型、自动驾驶大模型

L2:垂直场景专用模型(细分任务专用)

在行业模型基础上针对单一细分任务专项训练,精度最高、泛化最弱

  • 法律:合同审查模型、裁判文书生成模型
  • 医疗:CT 影像诊断、药品研发分子模型 AlphaFold2
  • 工业:质检视觉大模型、设备故障预测模型
  • 办公:PPT 生成、OCR 文档解析、代码审计专用模型

7、按部署运行形态(运维选型分类)

  • 云端 SaaS 模型:厂商 API 调用,无需本地算力,开箱即用(GPT、通义千问公有云)
  • 私有化本地部署模型:企业机房服务器部署,数据不出内网(开源 7B/13B/70B 系列)
  • 端侧离线模型:手机、平板、边缘硬件本地运行,无网络依赖(<10B 轻量模型)
  • 混合部署模型:轻量端侧做基础交互,云端大模型处理复杂推理

8、按开源 / 版权授权(生态分类)

  1. 闭源商用模型:权重不开放,仅开放 API,无法本地微调;OpenAI GPT、Anthropic Claude。
  2. 完全开源模型:权重、训练代码全开放,商用无限制;Qwen 全系列、DeepSeek。
  3. 受限开源模型:权重开放,商用有营收 / 规模限制;Llama3(Meta 商用许可)、Gemma。
  4. 学术开源模型:仅限科研,禁止商用;LLaVA、早期 BERT 变体。

9、按任务能力范式(功能分类)

1. 判别 / 理解型模型

输入数据做分类、打分、抽取、检索,不生成全新内容;BERT、向量检索模型、风险判别模型

2. 生成式模型(AIGC 核心)

输出全新文本 / 图像 / 音视频 / 代码;GPT、Sora、Stable Diffusion、CodeLlama

3. 推理数学专用模型

强化数理逻辑、符号计算、复杂数学证明;DeepSeek-Math、Qwen-Math、Numina

4. 检索增强 RAG 模型

底座 + 外挂知识库,解决实时信息、私有数据、幻觉问题;企业知识库问答系统专用

5. 机器人 / 具身智能大模型

文本视觉 + 机器人动作控制,物理世界交互;Google Robotics Transformer、特斯拉 FSD 大模型

6. 科学计算基础模型

面向科研:蛋白质结构、气象预测、流体仿真、量子计算;AlphaFold2、风乌气象大模型

10、极简分层总览

底层架构 → 模态输入 → 参数规模 → 训练阶段 → 应用层级 → 部署方式 → 开源属性 → 任务功能。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/22 9:44:10

强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (7)--- Policy Serving

0x00 概要 本系列的目的是&#xff1a;借着对 OpenClaw-RL 源码的学习&#xff0c;来梳理强化学习的一些相关概念和思想。所以&#xff0c;会有一些基础知识、扩展和发散&#xff0c;OpenClaw-RL 只是一个切入点。而且&#xff0c;因为整篇系列是一个整体&#xff0c;所以有些概…

作者头像 李华
网站建设 2026/7/22 9:43:49

UVa 11669 Non Decreasing Prime Sequence

题目描述 非递减素数序列&#xff08;NDPS\texttt{NDPS}NDPS&#xff09;是一个由素数组成的序列&#xff0c;满足第 iii 个元素不小于第 i−1i - 1i−1 个元素&#xff08;i>1i > 1i>1&#xff09;。一个 NDPS\texttt{NDPS}NDPS 的权重定义为该序列所有元素的乘积。 …

作者头像 李华
网站建设 2026/7/22 9:43:21

ComfyUI与Hermes Agent:自然语言控制AI绘画工作流

1. 项目概述&#xff1a;当Hermes Agent遇见ComfyUI ComfyUI作为当前最热门的Stable Diffusion可视化工作流工具&#xff0c;其节点式操作方式让AI绘画变得前所未有的灵活可控。而Hermes Agent作为新兴的AI智能体框架&#xff0c;通过集成ComfyUI技能包&#xff0c;实现了用自然…

作者头像 李华
网站建设 2026/7/22 9:39:41

临沂鑫旺2026 耐腐材质告别后期频繁更换

在户外环境中&#xff0c;标识标牌长期经受风吹日晒、雨雪侵蚀&#xff0c;褪色、起皮、变形等问题屡见不鲜。许多企业主或物业管理者往往陷入“年年安装、年年更换”的循环&#xff0c;既耗费预算&#xff0c;又影响形象。随着材料技术的迭代&#xff0c;2026年的户外标识标牌…

作者头像 李华
网站建设 2026/7/22 9:38:51

FTP服务部署与优化:vsftpd实战指南

1. FTP服务基础认知与选型考量 FTP&#xff08;File Transfer Protocol&#xff09;作为最古老的文件传输协议之一&#xff0c;至今仍在企业内部文件共享、网站内容更新等场景中广泛应用。我在实际运维工作中发现&#xff0c;虽然云存储方案日益普及&#xff0c;但FTP因其协议简…

作者头像 李华