当前(2025–2026)主流 LLM 已高度收敛到Decoder-only Transformer,但在超大参数区间普遍改用MoE(混合专家) 来把“总参数”和“激活参数”解耦。下面按「层数构成 → 参数分布规律 → 代表模型实测」三层说清楚。
一、网络层数的典型构成(Dense 与 MoE 通用骨架)
一个标准 Decoder-only Block(以 LLaMA / Qwen / DeepSeek 系为例)顺序是:
Input → Token Embedding → [ RMSNorm → Self-Attn(GQA/RoPE) → Res → RMSNorm → FFN/SwiGLU → Res ] × N → Final RMSNorm → LM Head(通常与 Embedding 共享权重)层数 L:7B 级约 28–36 层,70B 级约 80 层,超大规模 60–126 层。
Attention:现代全系RoPE + GQA(KV head 数远小于 Q head 数),DeepSeek 系用MLA(低秩压缩 KV)。
FFN:LLaMA-2 时代是 ReLU-FFN,LLaMA-3/Qwen3/DeepSeek 全是SwiGLU(gate/up/down 三个矩阵)。
MoE 变体:把部分层的 SwiGLU 换成“多个专家 FFN + Router”,Attention 仍共享;DeepSeek-V3 前 3 层是 Dense FFN,后 58 层是 MoE(256 路由 + 1 共享,激活 8+1)。
经验区间:hidden_dim d 与层数 L 大致满足
参数≈12·L·d²(Dense 近似),所以 7B≈32×4096² 量级,70B≈80×8192² 量级。
二、参数分布:“FFN 占 2/3” 是 Dense 模型的铁律
对 Dense 模型(LLaMA-3 / Qwen3-Dense / GPT-3 类),以 LLaMA-7B(d=4096, L=32, I=11008)为例拆开看:
组件 | 公式 | 参数量 | 占比 |
|---|---|---|---|
Token Embedding | V×d (32000×4096) | 128M | ~2% |
Attention(32层) | L×4d² | 2.05B | ~30% |
FFN/SwiGLU(32层) | L×3·d·I | 4.22B | ~63% |
RMSNorm + 偏置 | 可忽略 | <0.5% | <1% |
LM Head | 与 Embedding 共享 | 0 | 0% |
通用比例(1B–400B Dense 都成立):
Embedding/LM Head:1–3%(大词表如 Qwen 151K 会略高)
Attention(含 Q/K/V/O):25–30%
FFN/SwiGLU:60–68%
Norm 等:<1%
之所以 FFN 占大头,是因为经典 FFN 中间维I≈4d(SwiGLU 下I≈8d/3),单层 FFN 参数量3·d·I ≈ 8d²,而 Attention 只有4d²,比例稳定 2:1。
三、MoE 模型:总参数 vs 激活参数的分布彻底分化
MoE 不改变“单层结构”,只是把 FFN 复制成 E 个专家,因此静态总参数里 FFN 占比飙到 85–95%,但单 token 激活参数分布仍接近 Dense 比例。
以DeepSeek-V3(671B 总 / 37B 激活,61 层,d=7168)为例:
激活参数 37B 的内部切分:
Attention(61 层共享):~11.4B →31%
路由专家(58 层 × 激活 8 个):~20.4B →56%
共享专家(58 层 × 1):~2.5B → 7%
Dense FFN(前 3 层):~1.2B → 3%
LM Head:~0.9B → 2.5%
总参数 671B 里:256×58 个路由专家权重几乎全是“躺着的 FFN”,FFN 类权重占比>90%,Attention 只占 ~5%,Embedding/LM Head ~1.5%。
其他代表模型(2025–2026 在役):
模型 | 架构 | 层数 | 总/激活 | 专家设置 |
|---|---|---|---|---|
LLaMA-3 8B | Dense | 32 | 8B / 8B | – |
LLaMA-3 70B | Dense | 80 | 70B / 70B | GQA-8 |
LLaMA-3.1 405B | Dense | 126 | 405B / 405B | GQA-8, d=16384 |
Qwen3-32B | Dense | 64 | 32B / 32B | GQA-8 |
Qwen3-235B-A22B | MoE | 94 | 235B / 22B | 128 专家, top-8 |
DeepSeek-V3 | MoE+MLA | 61 | 671B / 37B | 256+1 共享, top-8 |
Mixtral 8×22B | MoE | 56 | 141B / 39B | 8 专家, top-2 |
四、一句话抓重点
层数:小模型 28–36,中模型 64–80,超大 Dense 126,超大 MoE 60 上下(但每层更宽)。
构成:RoPE + GQA/MQA/MLA + SwiGLU FFN + RMSNorm,LM Head 与 Embedding 通常共享。
Dense 参数分布:FFN ≈ 2/3,Attention ≈ 1/3,Embedding 忽略不计。
MoE 参数分布:总参数里 FFN 专家占 90%+;但每 token 激活的 37B/22B 里,FFN 仍约 60–65%,和 Dense 推理时的计算分布一致。
下面把上文里出现的英文单词、缩写、公式符号全部摊开成中文解释,按出现顺序归类,方便对照回看。
五、模型与架构名
LLM:Large Language Model,大语言模型。
Decoder-only Transformer:只用“解码器”部分的 Transformer 架构(GPT 系、Llama 系都是这种),不像原始 Transformer 那样有编码器+解码器。
Dense:稠密模型。每一层的所有参数对每个 token 都参与计算。
MoE:Mixture of Experts,混合专家。把 FFN 换成多个“专家”+一个路由器,每次只激活其中几个,总参数大但激活参数小。
LLaMA / Llama:Meta 出的开源模型系列(Llama-3 等)。
Qwen:阿里通义千问的模型系列(Qwen3 等)。
DeepSeek:深度求索公司的模型系列(V3、R1 等)。
GPT-3:OpenAI 早期稠密大模型。
Mixtral:Mistral AI 出的 MoE 模型(8×22B 指 8 个专家每次用 2 个)。
六、层结构与算子缩写
Block:Transformer 的一个重复单元(一层)。
RMSNorm:Root Mean Square Normalization,均方根归一化,比 LayerNorm 简单,Llama/Qwen/DeepSeek 都用它。
Self-Attn:Self-Attention,自注意力。
GQA:Grouped Query Attention,分组查询注意力。把 Q 分成几组共享同一份 K/V,省显存(如 GQA-8 = 8 组)。
MQA:Multi-Query Attention,多查询注意力,极端版 GQA(所有 Q 共享 1 份 K/V)。
MLA:Multi-head Latent Attention,多头潜在注意力(DeepSeek 用),把 K/V 压缩到低维潜空间再展开,省内存。
RoPE:Rotary Position Embedding,旋转位置编码,用旋转矩阵把位置信息融进 Q/K。
Res:Residual,残差连接(输出 = 子层(x) + x)。
FFN:Feed-Forward Network,前馈神经网络,Transformer 里每个 Block 后半段那个“升维再降维”的网。
SwiGLU:一种 FFN 激活组合(Swish + GLU),比老式 ReLU FFN 效果好;内部有 gate/up/down 三个矩阵。
ReLU-FFN:用 ReLU 做激活的老式前馈网络(Llama-2 之前常见)。
LM Head:语言模型输出头,把最后隐藏向量映射到词表概率,权重常和 Embedding 共享。
Embedding:词嵌入矩阵,把 token id 变成向量。
Router:MoE 里的路由函数,决定当前 token 送进哪几个专家。
Expert:专家,MoE 中替代原 FFN 的其中一个前馈子网络。
Shared Expert:共享专家,MoE 里所有 token 都会过的那个专家(DeepSeek 用)。
Top-k:路由器每次选 k 个专家(top-8 = 选 8 个)。
七、公式与维度符号
L:层数(number of layers)。
d / hidden_dim:隐藏维度,每个 token 向量的长度(如 4096、8192)。
I / 中间维:FFN 中间层维度,经典 Transformer 里 I ≈ 4d;SwiGLU 里 I ≈ 8d/3。
V:词表大小(vocab size),如 32000、151000。
Q/K/V/O:Query / Key / Value / Output 四个注意力矩阵。
KV head:K 和 V 的头数(GQA 下比 Q head 少)。
参数≈12·L·d²:Dense 模型粗略估算式——Attn 占 4Ld²,FFN(SwiGLU) 占 8Ld²,合起来 12Ld²(忽略 embedding 等)。
总参数 / 激活参数:MoE 里“总参数”是所有专家权重加起来;“激活参数”是单 token 实际经过的参数量(决定推理算力)。
八、具体数字里的写法
8×22B(Mixtral):8 个专家,每个专家约等于 22B 级别 FFN,总 141B,激活 39B。
235B-A22B(Qwen3 MoE):总 235B,激活 22B。
671B / 37B(DeepSeek-V3):总 671B,激活 37B。
256+1 共享, top-8:256 个路由专家 + 1 个共享专家,每次路由选 8 个路由专家 + 必过共享专家。
前 3 层 Dense,后 58 层 MoE:DeepSeek-V3 共 61 层,浅层不用 MoE,深层才切专家。