Qwen MoE 模型 3 分钟上手:30B 激活量只有 3B,显存直接省到 1/4
【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5
团队选模型卡在一个问题上:要效果就得上大参数,参数一大,GPU 预算和延迟也跟着涨。Qwen 给出的答案是混合专家(MoE)模型,比如 30B-A3B 和 235B-A22B。名字里的 "A" 是 activated 的缩写,30B-A3B 表示总参数 30B,但每个 token 只激活 3B。参数全存着、计算只走一小部分,这就是它比同档 Dense 模型省钱的根本原因。下面用官方仓库里的真实数据,一次讲清它怎么工作、有多快、怎么快速上手,以及什么团队该选它。
先看关键指标:MoE 和 Dense 差在哪 📌
命名规则先说清楚(docs/source/getting_started/concepts.md):Dense 模型直接用总参数量,如 4B、32B;MoE 用「总参数-A激活参数」,如 30B-A3B、235B-A22B。Qwen 谱系从 0.6B 到 235B-A22B 都开放了权重。
| 关键指标 | Qwen3-14B(Dense) | Qwen3-30B-A3B(MoE) |
|---|---|---|
| 每 token 实际激活参数 | 14B | 3B |
| 推理框架 | Transformers / SGLang / vLLM | SGLang、vLLM(需支持 MoE) |
| 典型单卡显存 | 33.3 GB(见下文实测) | 61.3 GB,但吞吐反而更高 |
| 适用定位 | 单卡、长文本、简单任务 | 要高能力又不想堆卡数的场景 |
| 框架 | 版本要求 | 出处 |
|---|---|---|
| vLLM | ≥0.9.0 | docs/source/deployment/vllm.md |
| SGLang | ≥0.4.6.post1 | README.md |
| Transformers | ≥4.51.0 | README.md |
一句话结论:MoE 的「总参数」决定能力上限和存储,「激活参数」决定单次计算量,两者拆开之后,成本和效果的绑定被松开了。
MoE 是怎么工作的:路由把 30B 拆成 3B 的活
MoE 替换的是 Transformer 里负责逐 token 变换的那一层。它内部放着一组并行子网络(叫专家),前面加一个路由网络:
- 路由网络对每个 token 给全体专家打分;
- 只挑分数最高的若干个专家参与计算,其余权重这轮完全不动;
- 选中的专家输出按分数加权求和,得到该 token 的层输出。
说白了,每个 token 走哪几位专家是逐 token 动态决定的,不同内容可以命中不同专家。注意:「K 具体等于几」这类细节要看具体模型的 config,本文不替你猜。
上图就是模型跑起来之后的样子。服务启动后,你像调用普通 OpenAI 接口一样对话,路由和专家选择在引擎内部完成,应用层完全无感。
实测速度与显存:只认仓库里的数字 📊
以下数据全部来自官方速度基准页 docs/source/getting_started/speed_benchmark.md,环境:H20 96GB 单卡,batch size 1,固定生成 2048 tokens。
| 模型 | 输入长度 | 量化 | 框架 | 速度 tokens/s | 显存 GB |
|---|---|---|---|---|---|
| Qwen3-30B-A3B | 30720 | BF16 | SGLang | 1283.94 | — |
| Qwen3-30B-A3B | 30720 | BF16 | Transformers | 27.03 | 61.3 |
| Qwen3-14B | 30720 | BF16 | Transformers | 155.38 | 33.3 |
把「总参数更大」和「速度更快」放在一起,才是 MoE 的意义:同输入 30720 下,14B 走 Transformers 是 155.38 tokens/s、33.3GB,而 30B-A3B 走 SGLang 能到 1283.94 tokens/s。激活量只有 3B,计算量当然压得下来。
更大的 235B-A22B 看这张(同页 SGLang 数据):
| 量化 | GPU 数 | 输入 129042 时速度 |
|---|---|---|
| BF16 | 8(TP=8) | 1639.54 tokens/s |
| FP8 | 4(TP=4) | 1319.66 tokens/s |
FP8 把卡数从 8 压到 4,速度只掉了 19%。MoE 的大参数不等于大成本,激活参数才是计算量的决定项。
快速上手:vLLM 一条命令启动 MoE 服务 🚀
生产部署推荐 vLLM(版本 ≥0.9.0),一条命令起 OpenAI 兼容服务:
vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --port 8000 --max-model-len 262144服务起在http://localhost:8000/v1。大陆网络可先设export VLLM_USE_MODELSCOPE=true从 ModelScope 拉权重,详见 docs/source/deployment/vllm.md。本地体验则用ollama run qwen3:8b或 LM Studio 加载 GGUF 即可。
选型建议:你的团队适合哪一款 ⚖️
- 单卡、小团队、要效果:选 30B-A3B。单张 H20 就能跑,能力接近更大 Dense 模型,延迟由 3B 的激活量决定。
- 多卡、生产环境、要顶格推理:选 235B-A22B。BF16 需 8 卡张量并行,上 FP8 可压到 4 卡(TP=4)。
- CPU 或消费级 GPU 为主:不用 MoE,走 Ollama / LM Studio + 量化版 GGUF,门槛最低。
- Apple Silicon:用 mlx-lm(≥0.24.0),找名字以 MLX 结尾的权重。
- 避坑:用 Transformers 直跑 30B-A3B 只有 27.03 tokens/s,MoE 的吞吐红利要靠 SGLang 或 vLLM 才拿得到。
延伸阅读
- 官方速度与显存基准:docs/source/getting_started/speed_benchmark.md
- vLLM 部署与调优(含 OOM 排查):docs/source/deployment/vllm.md
- 量化方案(FP8 / AWQ / GGUF):docs/source/quantization/awq.md
- 命名规则与关键概念:docs/source/getting_started/concepts.md
- 本地运行(Ollama / llama.cpp / LM Studio):docs/source/run_locally/ollama.md
- API 调用示例与思考模式开关:README.md
【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考