news 2026/9/4 11:28:24

Qwen MoE 模型 3 分钟上手:30B 激活量只有 3B,显存直接省到 1/4

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Qwen MoE 模型 3 分钟上手:30B 激活量只有 3B,显存直接省到 1/4

Qwen MoE 模型 3 分钟上手:30B 激活量只有 3B,显存直接省到 1/4

【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5

团队选模型卡在一个问题上:要效果就得上大参数,参数一大,GPU 预算和延迟也跟着涨。Qwen 给出的答案是混合专家(MoE)模型,比如 30B-A3B 和 235B-A22B。名字里的 "A" 是 activated 的缩写,30B-A3B 表示总参数 30B,但每个 token 只激活 3B。参数全存着、计算只走一小部分,这就是它比同档 Dense 模型省钱的根本原因。下面用官方仓库里的真实数据,一次讲清它怎么工作、有多快、怎么快速上手,以及什么团队该选它。

先看关键指标:MoE 和 Dense 差在哪 📌

命名规则先说清楚(docs/source/getting_started/concepts.md):Dense 模型直接用总参数量,如 4B、32B;MoE 用「总参数-A激活参数」,如 30B-A3B、235B-A22B。Qwen 谱系从 0.6B 到 235B-A22B 都开放了权重。

关键指标Qwen3-14B(Dense)Qwen3-30B-A3B(MoE)
每 token 实际激活参数14B3B
推理框架Transformers / SGLang / vLLMSGLang、vLLM(需支持 MoE)
典型单卡显存33.3 GB(见下文实测)61.3 GB,但吞吐反而更高
适用定位单卡、长文本、简单任务要高能力又不想堆卡数的场景
框架版本要求出处
vLLM≥0.9.0docs/source/deployment/vllm.md
SGLang≥0.4.6.post1README.md
Transformers≥4.51.0README.md

一句话结论:MoE 的「总参数」决定能力上限和存储,「激活参数」决定单次计算量,两者拆开之后,成本和效果的绑定被松开了。

MoE 是怎么工作的:路由把 30B 拆成 3B 的活

MoE 替换的是 Transformer 里负责逐 token 变换的那一层。它内部放着一组并行子网络(叫专家),前面加一个路由网络:

  1. 路由网络对每个 token 给全体专家打分;
  2. 只挑分数最高的若干个专家参与计算,其余权重这轮完全不动;
  3. 选中的专家输出按分数加权求和,得到该 token 的层输出。

说白了,每个 token 走哪几位专家是逐 token 动态决定的,不同内容可以命中不同专家。注意:「K 具体等于几」这类细节要看具体模型的 config,本文不替你猜。

上图就是模型跑起来之后的样子。服务启动后,你像调用普通 OpenAI 接口一样对话,路由和专家选择在引擎内部完成,应用层完全无感。

实测速度与显存:只认仓库里的数字 📊

以下数据全部来自官方速度基准页 docs/source/getting_started/speed_benchmark.md,环境:H20 96GB 单卡,batch size 1,固定生成 2048 tokens。

模型输入长度量化框架速度 tokens/s显存 GB
Qwen3-30B-A3B30720BF16SGLang1283.94
Qwen3-30B-A3B30720BF16Transformers27.0361.3
Qwen3-14B30720BF16Transformers155.3833.3

把「总参数更大」和「速度更快」放在一起,才是 MoE 的意义:同输入 30720 下,14B 走 Transformers 是 155.38 tokens/s、33.3GB,而 30B-A3B 走 SGLang 能到 1283.94 tokens/s。激活量只有 3B,计算量当然压得下来。

更大的 235B-A22B 看这张(同页 SGLang 数据):

量化GPU 数输入 129042 时速度
BF168(TP=8)1639.54 tokens/s
FP84(TP=4)1319.66 tokens/s

FP8 把卡数从 8 压到 4,速度只掉了 19%。MoE 的大参数不等于大成本,激活参数才是计算量的决定项。

快速上手:vLLM 一条命令启动 MoE 服务 🚀

生产部署推荐 vLLM(版本 ≥0.9.0),一条命令起 OpenAI 兼容服务:

vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --port 8000 --max-model-len 262144

服务起在http://localhost:8000/v1。大陆网络可先设export VLLM_USE_MODELSCOPE=true从 ModelScope 拉权重,详见 docs/source/deployment/vllm.md。本地体验则用ollama run qwen3:8b或 LM Studio 加载 GGUF 即可。

选型建议:你的团队适合哪一款 ⚖️

  • 单卡、小团队、要效果:选 30B-A3B。单张 H20 就能跑,能力接近更大 Dense 模型,延迟由 3B 的激活量决定。
  • 多卡、生产环境、要顶格推理:选 235B-A22B。BF16 需 8 卡张量并行,上 FP8 可压到 4 卡(TP=4)。
  • CPU 或消费级 GPU 为主:不用 MoE,走 Ollama / LM Studio + 量化版 GGUF,门槛最低。
  • Apple Silicon:用 mlx-lm(≥0.24.0),找名字以 MLX 结尾的权重。
  • 避坑:用 Transformers 直跑 30B-A3B 只有 27.03 tokens/s,MoE 的吞吐红利要靠 SGLang 或 vLLM 才拿得到。

延伸阅读

  • 官方速度与显存基准:docs/source/getting_started/speed_benchmark.md
  • vLLM 部署与调优(含 OOM 排查):docs/source/deployment/vllm.md
  • 量化方案(FP8 / AWQ / GGUF):docs/source/quantization/awq.md
  • 命名规则与关键概念:docs/source/getting_started/concepts.md
  • 本地运行(Ollama / llama.cpp / LM Studio):docs/source/run_locally/ollama.md
  • API 调用示例与思考模式开关:README.md

【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 11:24:08

AI Agent技能开发实战:基于Claude Code的营销自动化框架解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:23:58

微信聊天记录导出教程:4 条命令把微信记录变成 3 种文件格式

微信聊天记录导出教程:4 条命令把微信记录变成 3 种文件格式 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we…

作者头像 李华
网站建设 2026/9/4 11:22:56

单片机毕业设计-基于 STM32 或 51 单片机的带 GPS 定位车载酒精监控系统设计 基于 STM32 或 51 单片机的车辆酒精检测断电保护装置设计(020506)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

作者头像 李华
网站建设 2026/9/4 11:21:04

MATLAB GUI计算器:从入门到工程化开发全解析

简介:本资源是一份面向MATLAB初学者与课程设计实践者的GUI开发入门项目,聚焦简易计算器的完整实现,适用于高校《MATLAB程序设计》《数字系统仿真》等课程实训及本科毕业设计基础选题。压缩包共2个文件(26KB)&#xff0…

作者头像 李华
网站建设 2026/9/4 11:20:35

AI工程化编程实战:从CRUD到智能开发工作流设计

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:17:49

5 分钟跑通 PostgREST:从一张表到第一个 PostgreSQL REST API

5 分钟跑通 PostgREST:从一张表到第一个 PostgreSQL REST API 【免费下载链接】postgrest REST API for any Postgres database 项目地址: https://gitcode.com/GitHub_Trending/po/postgrest 你手边已经有一个 PostgreSQL 库,想立刻把它变成对外…

作者头像 李华