news 2026/7/24 15:21:52

LLM的层数和参数分布

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LLM的层数和参数分布

当前(2025–2026)主流 LLM 已高度收敛到Decoder-only Transformer,但在超大参数区间普遍改用MoE(混合专家)​ 来把“总参数”和“激活参数”解耦。下面按「层数构成 → 参数分布规律 → 代表模型实测」三层说清楚。

一、网络层数的典型构成(Dense 与 MoE 通用骨架)

一个标准 Decoder-only Block(以 LLaMA / Qwen / DeepSeek 系为例)顺序是:

Input → Token Embedding → [ RMSNorm → Self-Attn(GQA/RoPE) → Res → RMSNorm → FFN/SwiGLU → Res ] × N → Final RMSNorm → LM Head(通常与 Embedding 共享权重)
  • 层数 L:7B 级约 28–36 层,70B 级约 80 层,超大规模 60–126 层。

  • Attention:现代全系RoPE + GQA(KV head 数远小于 Q head 数),DeepSeek 系用MLA(低秩压缩 KV)。

  • FFN:LLaMA-2 时代是 ReLU-FFN,LLaMA-3/Qwen3/DeepSeek 全是SwiGLU(gate/up/down 三个矩阵)。

  • MoE 变体:把部分层的 SwiGLU 换成“多个专家 FFN + Router”,Attention 仍共享;DeepSeek-V3 前 3 层是 Dense FFN,后 58 层是 MoE(256 路由 + 1 共享,激活 8+1)。

经验区间:hidden_dim d 与层数 L 大致满足参数≈12·L·d²(Dense 近似),所以 7B≈32×4096² 量级,70B≈80×8192² 量级。

二、参数分布:“FFN 占 2/3” 是 Dense 模型的铁律

对 Dense 模型(LLaMA-3 / Qwen3-Dense / GPT-3 类),以 LLaMA-7B(d=4096, L=32, I=11008)为例拆开看:

组件

公式

参数量

占比

Token Embedding

V×d (32000×4096)

128M

~2%

Attention(32层)

L×4d²

2.05B

~30%

FFN/SwiGLU(32层)

L×3·d·I

4.22B

~63%

RMSNorm + 偏置

可忽略

<0.5%

<1%

LM Head

与 Embedding 共享

0

0%

通用比例(1B–400B Dense 都成立)

  • Embedding/LM Head:1–3%(大词表如 Qwen 151K 会略高)

  • Attention(含 Q/K/V/O):25–30%

  • FFN/SwiGLU:60–68%

  • Norm 等:<1%

之所以 FFN 占大头,是因为经典 FFN 中间维I≈4d(SwiGLU 下I≈8d/3),单层 FFN 参数量3·d·I ≈ 8d²,而 Attention 只有4d²,比例稳定 2:1。

三、MoE 模型:总参数 vs 激活参数的分布彻底分化

MoE 不改变“单层结构”,只是把 FFN 复制成 E 个专家,因此静态总参数里 FFN 占比飙到 85–95%,但单 token 激活参数分布仍接近 Dense 比例

DeepSeek-V3(671B 总 / 37B 激活,61 层,d=7168)为例:

  • 激活参数 37B 的内部切分:

    • Attention(61 层共享):~11.4B →31%

    • 路由专家(58 层 × 激活 8 个):~20.4B →56%

    • 共享专家(58 层 × 1):~2.5B → 7%

    • Dense FFN(前 3 层):~1.2B → 3%

    • LM Head:~0.9B → 2.5%

  • 总参数 671B 里:256×58 个路由专家权重几乎全是“躺着的 FFN”,FFN 类权重占比>90%,Attention 只占 ~5%,Embedding/LM Head ~1.5%。

其他代表模型(2025–2026 在役):

模型

架构

层数

总/激活

专家设置

LLaMA-3 8B

Dense

32

8B / 8B

LLaMA-3 70B

Dense

80

70B / 70B

GQA-8

LLaMA-3.1 405B

Dense

126

405B / 405B

GQA-8, d=16384

Qwen3-32B

Dense

64

32B / 32B

GQA-8

Qwen3-235B-A22B

MoE

94

235B / 22B

128 专家, top-8

DeepSeek-V3

MoE+MLA

61

671B / 37B

256+1 共享, top-8

Mixtral 8×22B

MoE

56

141B / 39B

8 专家, top-2

四、一句话抓重点

  • 层数:小模型 28–36,中模型 64–80,超大 Dense 126,超大 MoE 60 上下(但每层更宽)。

  • 构成:RoPE + GQA/MQA/MLA + SwiGLU FFN + RMSNorm,LM Head 与 Embedding 通常共享。

  • Dense 参数分布:FFN ≈ 2/3,Attention ≈ 1/3,Embedding 忽略不计。

  • MoE 参数分布:总参数里 FFN 专家占 90%+;但每 token 激活的 37B/22B 里,FFN 仍约 60–65%,和 Dense 推理时的计算分布一致。

下面把上文里出现的英文单词、缩写、公式符号全部摊开成中文解释,按出现顺序归类,方便对照回看。

五、模型与架构名

  • LLM:Large Language Model,大语言模型。

  • Decoder-only Transformer:只用“解码器”部分的 Transformer 架构(GPT 系、Llama 系都是这种),不像原始 Transformer 那样有编码器+解码器。

  • Dense:稠密模型。每一层的所有参数对每个 token 都参与计算。

  • MoE:Mixture of Experts,混合专家。把 FFN 换成多个“专家”+一个路由器,每次只激活其中几个,总参数大但激活参数小。

  • LLaMA / Llama:Meta 出的开源模型系列(Llama-3 等)。

  • Qwen:阿里通义千问的模型系列(Qwen3 等)。

  • DeepSeek:深度求索公司的模型系列(V3、R1 等)。

  • GPT-3:OpenAI 早期稠密大模型。

  • Mixtral:Mistral AI 出的 MoE 模型(8×22B 指 8 个专家每次用 2 个)。

六、层结构与算子缩写

  • Block:Transformer 的一个重复单元(一层)。

  • RMSNorm:Root Mean Square Normalization,均方根归一化,比 LayerNorm 简单,Llama/Qwen/DeepSeek 都用它。

  • Self-Attn:Self-Attention,自注意力。

  • GQA:Grouped Query Attention,分组查询注意力。把 Q 分成几组共享同一份 K/V,省显存(如 GQA-8 = 8 组)。

  • MQA:Multi-Query Attention,多查询注意力,极端版 GQA(所有 Q 共享 1 份 K/V)。

  • MLA:Multi-head Latent Attention,多头潜在注意力(DeepSeek 用),把 K/V 压缩到低维潜空间再展开,省内存。

  • RoPE:Rotary Position Embedding,旋转位置编码,用旋转矩阵把位置信息融进 Q/K。

  • Res:Residual,残差连接(输出 = 子层(x) + x)。

  • FFN:Feed-Forward Network,前馈神经网络,Transformer 里每个 Block 后半段那个“升维再降维”的网。

  • SwiGLU:一种 FFN 激活组合(Swish + GLU),比老式 ReLU FFN 效果好;内部有 gate/up/down 三个矩阵。

  • ReLU-FFN:用 ReLU 做激活的老式前馈网络(Llama-2 之前常见)。

  • LM Head:语言模型输出头,把最后隐藏向量映射到词表概率,权重常和 Embedding 共享。

  • Embedding:词嵌入矩阵,把 token id 变成向量。

  • Router:MoE 里的路由函数,决定当前 token 送进哪几个专家。

  • Expert:专家,MoE 中替代原 FFN 的其中一个前馈子网络。

  • Shared Expert:共享专家,MoE 里所有 token 都会过的那个专家(DeepSeek 用)。

  • Top-k:路由器每次选 k 个专家(top-8 = 选 8 个)。

七、公式与维度符号

  • L:层数(number of layers)。

  • d / hidden_dim:隐藏维度,每个 token 向量的长度(如 4096、8192)。

  • I / 中间维:FFN 中间层维度,经典 Transformer 里 I ≈ 4d;SwiGLU 里 I ≈ 8d/3。

  • V:词表大小(vocab size),如 32000、151000。

  • Q/K/V/O:Query / Key / Value / Output 四个注意力矩阵。

  • KV head:K 和 V 的头数(GQA 下比 Q head 少)。

  • 参数≈12·L·d²:Dense 模型粗略估算式——Attn 占 4Ld²,FFN(SwiGLU) 占 8Ld²,合起来 12Ld²(忽略 embedding 等)。

  • 总参数 / 激活参数:MoE 里“总参数”是所有专家权重加起来;“激活参数”是单 token 实际经过的参数量(决定推理算力)。

八、具体数字里的写法

  • 8×22B(Mixtral):8 个专家,每个专家约等于 22B 级别 FFN,总 141B,激活 39B。

  • 235B-A22B(Qwen3 MoE):总 235B,激活 22B。

  • 671B / 37B(DeepSeek-V3):总 671B,激活 37B。

  • 256+1 共享, top-8:256 个路由专家 + 1 个共享专家,每次路由选 8 个路由专家 + 必过共享专家。

  • 前 3 层 Dense,后 58 层 MoE:DeepSeek-V3 共 61 层,浅层不用 MoE,深层才切专家。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/24 15:16:41

UE4拖影效果实现:蓝图与渲染管线方案深度解析与实战

1. 项目概述&#xff1a;为什么我们需要关注拖影效果 在Unreal Engine 4&#xff08;UE4&#xff09;里做特效或者动作游戏&#xff0c;你有没有遇到过这样的问题&#xff1a;角色快速移动时&#xff0c;画面干净利落&#xff0c;但总觉得少了点“速度感”和“力量感”&#xf…

作者头像 李华
网站建设 2026/7/24 15:11:12

C++统一内存管理实战:原理、优化与异构计算应用

1. 项目概述&#xff1a;为什么统一内存管理是C开发者的新必修课&#xff1f;如果你是一名C开发者&#xff0c;最近在调试一个大型项目时&#xff0c;是否曾被“野指针”、“内存泄漏”或者“数据竞争”搞得焦头烂额&#xff1f;又或者&#xff0c;在尝试将CPU上的算法移植到GP…

作者头像 李华
网站建设 2026/7/24 15:09:28

基于YOLO与SpringBoot的安全锥智能检测系统实践

1. 项目概述&#xff1a;安全锥检测系统的技术架构这个基于YOLO系列模型与SpringBoot的安全锥检测系统&#xff0c;本质上是一个融合了深度学习与Web技术的智能视觉解决方案。我在实际道路施工安全监测项目中验证过&#xff0c;这类系统能够将传统人工巡检效率提升20倍以上。系…

作者头像 李华
网站建设 2026/7/24 15:09:26

蓝桥杯油漆面积题解:扫描线算法与线段树实现矩形面积并计算

1. 项目概述与问题拆解 “油漆面积”这个题目&#xff0c;乍一看名字挺生活化&#xff0c;但做过蓝桥杯或者信奥赛题的朋友都知道&#xff0c;这绝对是个“坑”不少的经典题目。它本质上是一个计算几何问题&#xff0c;核心是求解平面上多个矩形覆盖的总面积。听起来简单&#…

作者头像 李华
网站建设 2026/7/24 15:09:23

TI ADC12DJ3200低功耗背景校准(LPBG)模式详解与配置实战

1. 项目概述与核心价值在高速数据采集、无线通信基站或者雷达信号处理这类对连续性和精度要求都极高的系统中&#xff0c;模数转换器&#xff08;ADC&#xff09;的长期稳定性是个让人头疼的问题。温度变化、电源波动、器件老化&#xff0c;这些因素都会让ADC的零点、增益甚至采…

作者头像 李华