【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
Qwen-Image-2.1是 Qwen 家族最强的开源图像生成模型:7B 参数的统一文生图 + 图像编辑模型,支持原生透明背景(RGBA)、最多 10 张参考图合成、圆圈局部编辑与 2K 原生分辨率。本指南面向新手,按硬件从 24G 消费级显卡到多卡数据中心逐档给出部署方案,并完整覆盖CPU Offload 显存优化,帮你把显存占用踩准、把部署一次跑通。
一、Qwen-Image-2.1 部署前:硬件选型与显卡显存要求
先对号入座,确定你的部署档位:
| 部署场景 | 推荐配置 | 核心策略 |
|---|---|---|
| 🏠 单卡 24G 消费级显卡 | 1×24G 显存 + 64G 内存 | CPU Offload(CPU 卸载)+ bfloat16 |
| 🏢 多卡数据中心 | 2/4/8 卡(A100/H100 等) | 张量并行 TP + Ulysses 并行 + FP8 量化 |
| 🔴 AMD 显卡 | ROCm + PyTorch + Diffusers | 与 NVIDIA 用法一致 |
| ⚙️ 异构 AI 芯片 | FlagOS 软件栈 | 一次开发、多芯片运行,推理精度对齐官方实现 |
模型关键参数速览:视觉生成组件7B 参数(32 层单流 DiT),默认出图2048×2048、40 步去噪。bfloat16 下权重约 14GB,叠加 VAE 与激活开销后,12G 显卡裸载会爆显存——这正是 CPU Offload 登场的位置。
二、环境安装与首次文生图(Diffusers 路线)
Diffusers 自 Day 0 起就通过QwenImage21Pipeline支持 Qwen-Image-2.1,单卡部署首选这条路。
pip install torch>=2.4.0 pip install transformers>=5.17 pip install git+https://github.com/huggingface/diffusers pip install accelerate pip install pillow首次生成一张图(单卡、bf16 直接上卡):
import torch from diffusers import QwenImage21Pipeline pipe = QwenImage21Pipeline.from_pretrained( "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16 ).to("cuda") image = pipe( prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement", num_inference_steps=40, generator=torch.Generator("cuda").manual_seed(42), ).images[0] image.save("t2i_example.png")三、图像编辑:多图参考与透明背景生成
编辑只需在调用时传入image参数,最多支持10 张参考图(多主体合成、穿搭装配都靠它):
images = [Image.open(f"ref_{i}.png") for i in range(3)] result = pipe( prompt="These three characters are sitting around a campfire in a forest", image=images, num_inference_steps=40, ).images[0]🎨透明背景(RGBA):模型原生支持透明图,按官方推荐句式提问效果最佳:
This is an RGBA image with transparency. <你的描述>. The image has alpha channel and the background is transparent.
常用画幅推荐尺寸(2K 原生分辨率):
| 画幅 | 尺寸 | 画幅 | 尺寸 |
|---|---|---|---|
| 1:1 | 2048×2048 | 16:9 | 2752×1536 |
| 4:3 | 2400×1792 | 9:16 | 1536×2752 |
| 3:2 | 2528×1696 | 3:4 / 2:3 | 竖版对调 |
想要"官方同款"出图?仓库里附了现成示例素材,可直接拿来当编辑输入:
- 编辑任务示例图:prompt_rewrite/data/images/
- 输入样例(JSONL):prompt_rewrite/data/edit_example.jsonl、prompt_rewrite/data/t2i_example.jsonl
四、24G 显存怎么跑:CPU Offload 显存优化
这是消费级显卡的核心技巧。加载模型时先不调用.to("cuda"),改为开启 CPU Offload:
pipe = QwenImage21Pipeline.from_pretrained( "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16 ) pipe.enable_model_cpu_offload()原理:权重常驻内存,每个去噪步前只把当前用到的组件搬上 GPU、用完即换下,显存峰值大幅下降,代价是单步略有等待。实操要点:
- 系统内存建议64G(prompt_rewrite/README.md 对 9B 改写模型的内存结论同样适用:64G 完全够用)
- 嫌慢就降分辨率(如 1536×1536)或减步数,画质损失有限
- 多卡机想"省显存又要快",直接跳到下一节的并行方案
五、多卡数据中心部署:vLLM / SGLang / LightX2V 加速
单卡瓶颈时,三条高性能路线任选:
1️⃣ vLLM-Omni—— Day 0 即支持前缀 KV 缓存、CUDA Graph 解码、FP8 量化与张量/Ulysses 序列并行:
# 离线推理(文生图) python examples/offline_inference/text_to_image/text_to_image.py \ --model Qwen/Qwen-Image-2.1 --prompt "A ceramic teapot on a wooden table" \ --output qwen21_t2i.png --num-inference-steps 40 # 在线服务 vllm serve Qwen/Qwen-Image-2.1 --omni --port 8091 # 高并发时加步骤级调度: # vllm serve Qwen/Qwen-Image-2.1 --omni --step-execution --max-num-seqs 8服务起好后可用 OpenAI 风格 API 请求:
curl http://localhost:8091/v1/images/generations \ -H "Content-Type: application/json" \ -d '{"model":"Qwen/Qwen-Image-2.1","prompt":"A ceramic teapot on a wooden table","size":"1024x1024","num_inference_steps":40,"seed":42}'2️⃣ SGLang-Diffusion—— 原生支持 TP / Ulysses / Ring / CFG 多种并行 + 组件级卸载(component offload):
sglang generate --model-path Qwen/Qwen-Image-2.1 \ --prompt "A capybara reading a book by candlelight" \ --height 1024 --width 1024 --num-inference-steps 40 --seed 42 --save-output3️⃣ LightX2V—— 专为消费级与数据中心 GPU 双端优化的速度/显存框架,同样支持文生图与编辑。
🔧显存紧张时的三板斧(vLLM-Omni 路线):FP8 量化权重与前缀 KV → 张量并行切分 → 组件 CPU 卸载。显存越紧,优先级越靠前叠加。
另外,AMD 显卡可走 ROCm + PyTorch + Diffusers;国产/异构芯片可通过 FlagOS 一次开发多芯片运行,精度对齐官方实现,体验与 NVIDIA 完全一致。
六、出图质量加成:官方提示词改写器(Prompt Rewriting)
官方提供两个微调的 Qwen3.5-VL 9B 改写模型(文生图 T2I / 图像编辑 Edit 各一),把一句话短提示扩写成细腻长描述,并自动决定输出画幅。代码位于 prompt_rewrite/:
| 入口 | 用途 |
|---|---|
| prompt_rewrite/run_vllm.py | vLLM 离线批量改写(生产推荐) |
| prompt_rewrite/run_transformers.py | 单请求验证/调参 |
| prompt_rewrite/serve.sh + prompt_rewrite/client.py | OpenAI 兼容在线服务 |
| prompt_rewrite/pe_core.py | 任务配置与解析核心 |
cd prompt_rewrite pip install -r requirements.txt # 文生图改写(vLLM 批量) python run_vllm.py --task t2i \ --ckpt Qwen/Qwen-Image-2.1-PE-T2I \ --input data/t2i_example.jsonl --output out.jsonl输出包含rewritten_prompt(改写后提示词)与wh_ratio(模型选定的画幅,如"16:9"),交给管线时按上文画幅表映射为宽高即可。💡24G 卡跑 vLLM 注意:权重约 20GB(bf16),加--max-model-len 12000或调低--gpu-memory-utilization即可稳妥运行(详见 prompt_rewrite/README.md);多卡可用TP=2 bash serve.sh切分。
七、常见问题 FAQ
Q:24G 显存的消费级显卡能完整跑 2K 出图吗?A:可以。bf16 +enable_model_cpu_offload()即可稳定运行 2048×2048、40 步;追求速度则降到 1536 边长。
Q:多卡部署怎么选?A:数据中心优先 vLLM-Omni(FP8 + 张量并行 + Ulysses 并行 + 组件卸载),高并发服务加--step-execution;需要更灵活并行组合时选 SGLang。
Q:CPU Offload 之后内存占多少?A:权重常驻内存约 14GB 起,建议系统内存 64G;速度上会比全卡加载略慢,属于显存与速度的平衡项。
Q:模型文件从哪来?A:HuggingFace / ModelScope 搜索Qwen/Qwen-Image-2.1下载权重即可;本仓库(LICENSE)提供代码与工具链。
【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
相关推荐
省17GB显存的秘密:Qwen-Image-2.1-GGUF低显存推理优化完整攻略
省17GB显存的秘密:Qwen Image 2.1 GGUF低显存推理优化完整攻略 Qwen Image 2.1 GGUF 是通义万相 Qwen Image 2
人工智能大模型模型量化本地部署媒体生成Python抢票脚本:大麦演唱会门票自动化完整指南
Python抢票脚本:大麦演唱会门票自动化完整指南 这是一个大麦自动抢票的 Python 抢票脚本项目。它用 Selenium 和 Appium 双端驱动浏览器
GUI 自动化RPAQwen-Image-2.1 GGUF 本地部署指南:量化文件选择、ComfyUI 环境配置与显存优化实战
Qwen Image 2.1 GGUF 本地部署指南:量化文件选择、ComfyUI 环境配置与显存优化实战 本指南基于 abenzerps/Qwen Image
人工智能大模型模型量化本地部署媒体生成
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考