昨天把 ComfyUI 更新到了 v0.37,顺手把 Qwen-Image-2.1 跑通了。整个过程比我预想的顺利,但中间也踩了几个坑——比如模型路径不对、采样器选错导致画面发灰、爆内存等等。这篇就好好记录一下,从下载模型到稳定出图的完整流程,顺带聊聊新版本里那些值得注意的变化。无论你是在用秋叶整合包的懒人,还是准备切换到官方版的老手,这篇文章应该都能帮你省点时间。
先说结果:v0.37 的启动速度确实比老版本快了一截,对 Qwen-Image-2.1 这类新模型的兼容性也明显更好。我之前在 v0.32 上连模型都加载不成功,换到 v0.37 之后直接跑通了。如果你一直因为"能用就不折腾"而卡在旧版本,这次建议认真考虑升级,尤其是对中文提示词要求比较高的话,2.1 这个模型值得专门为它折腾一次。
1. 版本升级:ComfyUI v0.37 到底改了什么
1.1 为什么值得从老版本升级
很多人还在用秋叶整合包的老版本,或者下载之后大半年没更新过。但这次 v0.37 的实际体验下来,变化不小。最直观的是启动速度,我这边从点击启动到出现界面,比 v0.32 快了大概三秒左右。别小看这三秒,工作流复杂之后体感差距会拉大。官方的更新日志里写的基本都是性能优化和 bug 修复,但真正让我惊喜的是对 Qwen 系列模型的底层调度器做了调整,采样过程更稳定,出图时不再有那种奇怪的色彩断层。
另外,v0.37 里新增了几个原生节点,主要是关于模型加载和采样器调度的。以前很多功能必须靠第三方插件,现在官方直接把入口做进去了,少了一层兼容性问题。比如以前加载 GGUF 量化模型需要额外配合一个插件,现在 v0.37 搭配最新版 ComfyUI-GGUF 插件,加载路径和参数传递都顺畅得多。如果你用的还是老版本,建议先看一眼自己的 PyTorch 版本,v0.37 对 PyTorch 2.1 以上支持最好,太低的话容易在加载模型时莫名其妙报错。
1.2 升级前必做的三件事
升级前千万别直接覆盖整个文件夹,尤其是用了很久的整合包用户。我见过太多人图省事,直接把新版压缩包解压到旧目录里,结果 custom_nodes 里一堆插件全部失联,最后只能重装。这里我整理了几条实操经验:
第一,备份 custom_nodes 目录。这个目录里存的是所有插件,升级后插件版本可能不兼容,备份后可以逐个排查。如果用的是秋叶整合包,默认路径在ComfyUI_windows_portable\ComfyUI\custom_nodes下。
第二,备份extra_model_paths.yaml。这个文件记录了模型目录的额外路径,很多人会把模型放在独立硬盘或移动硬盘里,靠这个文件引用。升级时如果不小心覆盖了,所有模型路径都会失效,到时候启动器会提示找不到模型。
第三,检查 Python 环境。v0.37 官方推荐 Python 3.11 以上,如果你还在用 Python 3.8 之类的老版本,建议先升级环境再更新 ComfyUI,否则加载新版节点时容易遇到SyntaxError,排查起来非常头疼。
升级完成之后,第一次启动会重新下载依赖,别急,等它跑完。如果启动器让你选择是否更新所有插件,我建议暂时不要全选,先更新 Core 部分,插件后续逐个更新。实测全部一次性更新很容易出兼容性问题,反而拖慢进度。
2. 模型选型:Qwen-Image-2.1 凭什么被选上
2.1 Qwen-Image-2.1 相比旧版强在哪
Qwen-Image-2.1 是通义团队推出的图像生成模型,简单说就是一个专门用来"画图"的大模型,吃提示词,出图片。2.1 相比 2.0 和 1.0 最大的变化在于中文理解能力上了一个大台阶。以前我拿中文提示词给很多模型试过,不是输出乱码就是直接忽略掉。但 2.1 这个版本,我直接写"一栋江南水乡的老房子,雨后青石板路,远处有雾气",它给我出出来的图基本把关键词都对应上了,连雨后的湿润感都表达得很到位,这在以前的版本里很难做到。
另一个明显进步是对画面布局的控制。同一个提示词,2.0 可能总喜欢把主体放中间,而 2.1 能根据语义自动调整构图,比如"一列蒸汽火车从画面左侧驶向右侧",它真的会把火车放在偏左的位置,留出右侧的空间感。这种理解能力,对做概念设计、插画、封面图的人来说非常实用。另外它支持多分辨率出图,从正方形到超宽幅都能处理,且不会像某些模型那样低分辨率下直接糊成一片。
2.2 官方权重还是 GGUF 量化版
模型下载时通常会看到两种形式:官方权重和 GGUF 量化版。官方权重一般是 fp16/bf16 格式,精度高,但文件很大,光 main 模型可能就十几个 G,显存不够的话直接 out of memory。GGUF 量化版则是把模型压缩到四分之一甚至更小,比如 q4_K_M、q8_0 之类的版本,用一点点画质换显存占用的大幅降低。
如果你显卡显存在 8G 左右,强烈建议直接上 GGUF 量化版。我在一张 8G 显存的卡上跑过,q4_K_M 版本下,1024x1024 分辨率出图,显存占用刚好卡在 7G 出头,还能流畅运行。如果显存是 12G 以上,可以试试官方 bf16 格式,画质细节确实更丰富,尤其是在纹理和明暗过渡上,肉眼可见的细腻。如果你追求极致效率,宁可牺牲一点细节,那 GGUF q8 是折中好选择,文件相对小,质量损失也不大。
选型时还有一点要格外注意:GGUF 版本需要配合专门的加载器节点,不能直接用默认的 Checkpoint Loader,否则会提示文件格式不识别。我在 v0.37 里搭配最新版 ComfyUI-GGUF 插件,加载和使用都正常,但在老版本上就会出各种幺蛾子,所以前面强调的新版兼容性不是空话。
3. 完整实操:把 Qwen-Image-2.1 跑起来的全过程
3.1 环境准备与依赖安装
先说环境。我是在 Windows 上操作的,基本配置是 Win11、Python 3.11、CUDA 12.1、PyTorch 2.2。如果你用的是秋叶整合包,里面本来就把这些环境打包好了,只需要注意版本别太旧。如果你的整合包停留在 v3.x 时代,建议先更新到 2026 版本,不然可能连 v0.37 的核心文件都认不出来。
依赖方面,ComfyUI 管理器有 "Install Missing Custom Nodes" 这个功能,打开后会自动检测缺哪个节点插件。Qwen-Image-2.1 想要顺利跑通,我实测需要这几个东西:ComfyUI-GGUF、ComfyUI-Custom-Scripts(可选,但建议装)、以及一个比较新的ComfyUI内核。如果你不想装完报错,可以在启动后打开管理器的 "Custom Nodes Manager",搜索 Qwen 或 Image,通常能找到相关的推荐插件,直接一键安装。
模型下载我建议优先从 ModelScope 或 Hugging Face 拉,根据你网络情况选择。把下载好的模型文件放到对应的目录:官方权重放在ComfyUI\models\checkpoints目录下,GGUF 量化版通常放在ComfyUI\models\unet目录下。注意,很多人就死在这一步——路径放错,节点报错,然后到处找原因。建议下载前先看清楚文件名后缀,如果文件是.safetensors结尾,一般就是官方权重;如果是.gguf结尾,就放到 unet 或专门指定的量化模型目录。
3.2 搭建 Qwen-Image-2.1 工作流
跑通 Qwen-Image-2.1 并不需要特别复杂的工作流,我用的核心流程是:加载模型、输入提示词、进入采样器、解码、保存图像。但有几个节点和参数是有讲究的。
首先是模型加载节点。如果你用的是官方权重,直接用Load Checkpoint节点就行,但如果你用的是 GGUF 量化版,必须使用Unet Loader (GGUF)节点,然后在旁边拉一个CLIP Loader和VAE Loader来配套。我第一次加载时直接用了默认 Load Checkpoint,结果直接报"unknown model format",后来换成 Unet Loader (GGUF) 才正常。
然后是 CLIP 文本编码。Qwen-Image-2.1 有专属的 CLIP 节点,官方工作流里通常叫Qwen-Image Text Encode或类似的名字,千万不能用通用的 CLIP Text Encode,否则提示词语义会被阉割得很严重,出图效果大打折扣。我在 v0.37 里直接在节点列表搜 "Qwen" 就能找到,拖出来连接就行。
采样器建议选择euler采样方法,调度器选择normal或karras,步数设置在 25 到 30 之间,CFG 控制在 3 到 4 之间。这个组合是我反复试出来的,画面稳定性和细节保留度都很不错。如果你把 CFG 拉太高,比如到 7 以上,画面会发灰、发糊,这也是 2.1 这个模型和 SD 系列非常不一样的地方。
3.3 出图测试与参数微调
第一次出图,建议先跑一张分辨率 512x512 来验证流程是否正常,然后再逐步放大到 1024 甚至更高。不要把参数一次性拉满,否则你很难判断问题是出在模型、采样器还是显存不够。
我实测正面提示词直接输入中文:一个戴竹编斗笠的少女,站在梯田边,远处有云雾,整体色调偏暖。负面提示词我简单写了:模糊、变形、水印。出图效果非常符合预期,斗笠的编织纹理居然能看出竹条的交叉感,梯田的层次也自然,没有出现常见的重复纹理或扭曲手指问题。这里说明 2.1 对复杂中文提示词的理解确实在行业里属于第一梯队了。
如果你出图后觉得画面发灰,检查一下 VAE 是不是没连上,或者采样器的 CFG 是不是太高。如果觉得构图呆板,可以适当增加每张图的随机种子变化,让模型在保持主体一致的情况下多给几组候选图。我用ControlNet结合 Qwen-Image-2.1 做了几次测试,发现它对姿态控制的理解也不错,可以做到"指定手部姿势"这种精细操作,这在以前是很难的。
4. 避坑合集:从爆内存到模型下载失败的实战排查
4.1 典型报错速查表
这段时间我碰到的典型报错,整理成一个速查表,你如果遇到同样问题可以直接对照排查。
| 报错信息 | 可能原因 | 解决方法 |
|---|---|---|
| CUDA out of memory | 显存不够 | 换 GGUF 量化版,或者降低采样分辨率 |
| Unknown model format | 模型路径或格式不匹配 | 确认是 checkpoint 还是 GGUF,注意放置目录 |
| No module named 'xxxx' | 缺少依赖插件 | 打开 ComfyUI 管理器一键安装缺失节点 |
| Model requested by load ... not found | 模型路径错误 | 检查extra_model_paths.yaml配置 |
| RuntimeError: shape mismatch | 模型与节点版本不匹配 | 升级 ComfyUI 内核和 Qwen 相关插件到最新 |
| 启动后界面加载不出节点 | 浏览器缓存 | 清空浏览器缓存,或按 F5 强制刷新 |
其中CUDA out of memory是最常见也最疼的。我遇到过一次在批量出图时爆内存,卡死整个进程,解决办法是把批量大小拆成单张跑,或者把图块尺寸调小。v0.37 本身对显存占用做了一些优化,但如果你把批次设成 4,再叠加 1024 分辨率,该爆还是会爆。
4.2 整合包用户的安全升级姿势
如果你一直用秋叶整合包,先别急着卸载。秋叶整合包的优势是开箱即用,环境、依赖、插件都配好了。但它的缺点是版本更新滞后,很多时候官方仓库的插件已经更新了,整合包里还是老版本。这时你只要在整合包目录下找到更新ComfyUI.bat或类似的脚本,点击运行,就能把 ComfyUI 内核更新到最新。更新之后,注意第一件事就是去管理面板执行 "Update All",把所有插件同步到最新版本,否则会出现新旧不兼容。
另外一个很常见的坑:整合包版本太老,比如还停留在 v2024 之前的,更新时会因为 Python 环境不匹配导致启动失败。这种时候我建议直接下载一个最新版官方 ComfyUI 桌面版,然后手动把模型和插件目录硬链接或复制过去,这样既省心又干净。别心疼那点迁移时间,用一次干净的基础,后面省十倍时间。
4.3 手机版、远程查看出图时的地址怎么填
热词里有人问"ComfyUI手机版地址怎么填",我给一个通用经验。手机版本质是远程访问电脑上运行的 ComfyUI 服务,而不是在手机本地跑模型。你要做的就是在电脑的启动器配置里,把--listen参数加上,然后在手机上用浏览器访问电脑的局域网 IP 地址加端口,比如192.168.1.100:8188。注意这个 IP 是电脑的局域网 IP,不是手机自己的 IP,也不是 localhost。如果你填localhost:8188,对着电脑屏幕可能没问题,但换个设备就不通了。
还有一点,手机端访问时建议连接同一个 Wi-Fi,然后关闭电脑防火墙或添加白名单,否则手机搜不到端口。另外手机端主要适合查看出图进度、远程控制生成,真正跑大模型还是靠电脑的显卡,手机只是"遥控器"。
5. 性能调优与工作流扩展
5.1 显存不足时的四招优化
很多人问"ComfyUI生成视频时爆内存"怎么办,其实根源都是显存和内存调度的问题。结合 Qwen-Image-2.1 的实践,我总结出四个优化方案。
第一招,切换 GGUF 量化模型。这个前面说过了,q4_K_M 基本能把 8G 显存的压力压到极低,而且出图质量在大多数场景下和官方权重差不了多少。我拿同一个提示词对比过,除了极亮部和极暗部的细节有轻微损失,整体色彩和构图的差异很小。
第二招,降低采样分辨率。别一开始就上 1024x1024,可以先在 768x768 下构图,再用Latent Upscale节点放大到 1024 或更高,这样构图期间显存占用能低 30% 左右。Qwen-Image-2.1 对放大后的画面仍能保持一定程度的重绘,细节不会糊。
第三招,关闭不必要的前后端渲染。把 ComfyUI 管理面板里的预览模式从"每一帧预览"改成"完成后预览",可以省下不少显存。生成大批量时,这一步有时能避免卡死。
第四招,精简自定义节点。很多整合包会默认装几十个插件,但实际你把Unet Loader (GGUF)和 Qwen 相关节点用上,其他大部分用不到。可以在custom_nodes目录里暂时把不常用的文件夹改名,比如加.bak后缀,这样启动时就不会加载它们,整个工作流的占用会明显下降。
5.2 采样器参数微调技巧
关于采样器,很多人的理解还停留在"选个好看的就行",其实采样器的选择对 Qwen-Image-2.1 来说很关键。我实测下来的结果是:
- 步数 20 到 25 就能得到不错的画面,超过 40 之后细节提升趋近于零,但耗时翻倍。
- 调度器
normal最适合这个模型,karras在某些提示词下会出现过度锐化,画面显得有点脏。 - CFG 不要高于 5。Qwen-Image-2.1 对 CFG 非常敏感,太高了容易饱和过度,出现塑料质感。
seed固定时,可以通过微调variation_seed来产生同构图下的不同细节,这个在做系列图的时候很实用。
另外建议开启denoise strength控制。如果你是想基于一张图做二次微调,比如把白色背景人物变成海边背景,denoise在 0.5 到 0.7 之间效果最好,太高了主体会变形,太低了背景改不干净。这个机制相当于"重绘幅度",理解了它,图生图能力会有质的提升。
5.3 延伸玩法与后续扩展
Qwen-Image-2.1 跑通之后,玩法就不止文生图这么简单了。结合 ComfyUI 的工作流生态,你可以把它的输出接到其他节点上做进一步处理。比如做动态壁纸生成,你可以用 Qwen-Image-2.1 先生成静态画面,再通过AnimateDiff或视频生成模型把静止图变成动态效果。模板上可以做到"输入描述词,输出可用的动态壁纸",这已经有人在工作流分享社区里做过了。
还有人把它和ControlNet结合,先用 Qwen-Image-2.1 生成初始效果,再用Scribble或OpenPose姿态控制节点精修人物姿势,效果非常惊艳。这个组合特别适合角色设计、游戏原画、电商拍摄替代这类场景。如果你有一定代码基础,还可以把工作流导出成 API 调用,对接外部程序做批量生成,彻底自动化。
另外,v0.37 对 GGUF 的调度优化让我觉得,本地化部署 GGUF 量化版将会成为未来一段时间的主流。它最大的意义是让 8G 显存的用户也能跑起最新的模型,不用去云上烧钱。这个趋势对个人创作者来说是真香。
- 选型时,如果不是对画质有极致追求,优先考虑 GGUF 量化版,它能让你在低显存下保持稳定复现。
- 参数调优时,先固定种子和 CFG,再用步数和调度器去微调,这样每次改动都能定位到变量。
- 出图前先跑低分辨率验证,再放大到目标分辨率,避免一次拉满导致爆内存。
最后再分享一个小技巧,把 Qwen-Image-2.1 的出图过程录屏下来,你会发现采样器从噪声到图像的变化非常具有戏剧性。这个模型在低步数时就能形成清晰的语义结构,是你判断提示词是否被正确理解的最快方式。