ComfyUI-WanVideoWrapper 快速上手:4步装好,文生视频与图生视频一次跑通
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
ComfyUI-WanVideoWrapper 是一组针对 WanVideo 视频模型的 ComfyUI 自定义节点,一次装好就能覆盖文生视频、图生视频、视频风格迁移、姿态控制、音频驱动和视频超分六类玩法。它适合已经会用 ComfyUI 拉节点、想尽快出片的人;如果你刚装好 ComfyUI,跟着本文大约 30 分钟能跑出第一段视频。
1. 先跑起来:30 分钟内拿到第一段视频
装 ComfyUI 插件最常见的卡点不是代码,而是模型放错目录。这一节先把路铺平:硬件够不够、依赖装没装、模型放哪、启动后怎么验证。
硬件要求速查:什么显卡能跑
| 显卡显存 | 建议配置 | 预期体验 |
|---|---|---|
| 8GB | 1.3B 模型 + 块交换 + FP8 权重 | 480p 短片可出,速度慢 |
| 12GB | 1.3B 满配,或 14B + 块交换 | 512x512、81 帧主力档 |
| 16GB+ | 14B 模型,20/40 块换出后 512x512x81 约 16GB | 分辨率和帧数余量更大 |
参考数据:1.3B 文生视频模型用 81 帧的上下文窗口,显存占用不到 5GB,在 5090 上生成 1025 帧约 10 分钟。
Windows / macOS / Linux 各一条命令
三平台的步骤都是:把仓库克隆进 ComfyUI 的custom_nodes目录,再装依赖。
# Linux / macOS cd /path/to/ComfyUI/custom_nodes git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper pip install -r requirements.txtWindows 用官方绿色版时,在ComfyUI_windows_portable目录下执行:
python_embeded\python.exe -m pip install -r ComfyUI\custom_nodes\ComfyUI-WanVideoWrapper\requirements.txt💡 依赖清单很短(requirements.txt),核心是diffusers>=0.33.0、accelerate>=1.2.1、peft>=0.17.0,版本不够会直接导入报错,先升这三样。
4 类模型文件放哪
模型统一放 ComfyUI 的models目录,四类对号入座:
| 模型 | 目录 |
|---|---|
| 文本编码器 | ComfyUI/models/text_encoders |
| 视觉编码器 | ComfyUI/models/clip_vision |
| 主视频模型(transformer) | ComfyUI/models/diffusion_models |
| VAE | ComfyUI/models/vae |
作者推荐下载 FP8 缩放版权重:同样画质下显存占用明显更低,主模型加载节点的量化选项要选对应的_scaled档位,选错会直接报错。GGUF 格式的模型也能在主加载节点里直接用。
首次启动自检:5 项全过才算装好
- 重启 ComfyUI,节点搜索框输入
WanVideo,能列出加载、采样、潜变量等节点; - 控制台无红色导入报错(可选模块如 Ovi、Lynx 缺依赖时只警告,属正常);
- 模型加载节点的下拉里能选中你放进去的权重;
- 用仓库自带示例工作流跑一次最小档(512x512、81 帧、1.3B 模型),能出片;
- 输出的视频帧率是 16fps——这是 WanVideo 的默认采样帧率(shared_config.py 中
sample_fps = 16),不是你的设置错了。
2. 搞懂它:这些节点到底在干嘛
原理部分只用一个类比就说清楚。把生成一段视频比作开一家餐厅:
- 文本编码器是翻译官:把你的中文提示词翻成模型听得懂的向量。它本身不出菜,但翻译质量决定后厨理解。
- 视频生成器(transformer)是后厨主厨:从纯噪声开始,一步步"去噪"出画面,每步都参考翻译官的菜单。这是吃显存的大头,40 层注意力块就是主厨的 40 道工序。
- 控制模块是轨道:姿态关键点、控制网、相机轨迹等,把镜头和动作约束在既定路径上,主厨只能在轨道内发挥。
- 后处理单元是出餐前的摆盘:VAE 把压缩表示解码成像素,FlashVSR 这类超分节点再补细节。
记住一条主线就够了:噪声进,视频出,中间每一步由"菜单(文本)+ 轨道(控制)"约束。其余细节用到时再查对应节点。
3. 六大功能逐个拆:场景、参数、坑
每个功能按"适用场景 / 关键参数 / 易踩坑"三件套给。
文生视频(T2V)
- 适用场景:没有参考图,纯靠提示词生成场景片段,如环境空镜、氛围短片。
- 关键参数:采样步数默认 30、cfg 默认 6.0、shift 默认 5.0、调度器默认 unipc(nodes_sampler.py 默认值);帧数走 4n+1 规则,81 帧是常用档。
- 易踩坑:提示词里堆太多主体,画面会互相"打架";一句话说清"主体 + 动作 + 背景"更稳。
图像转视频(I2V)
- 适用场景:给一张图加运动,产品、角色、风景首帧都能用。
- 关键参数:首帧对齐靠 clip vision 编码,注意加载图与目标分辨率同比例,避免拉伸变形。
- 易踩坑:输入图里有大面积纯白背景时,运动容易糊边,先裁紧主体。
视频风格迁移(V2V)
- 适用场景:已有视频换画风/换质感,比整段重生成便宜得多。
- 关键参数:从干净视频起步时打开
add_noise_to_samples,denoise_strength 控制改动的幅度,1.0 是完全重绘。 - 易踩坑:denoise 低于 0.6 时风格几乎没变化,别误以为节点没生效。
音频驱动
- 适用场景:让画面跟着音频动,对口型、数字人播报。
- 关键参数:走 MultiTalk、HuMo、FantasyTalking 等节点组,各带自己的音频编码器。
- 易踩坑:音频采样率不匹配会静默失真,先用
pyloudnorm(依赖已含)归一化响度。
视频超分
- 适用场景:低分辨率结果补细节,先出 480p 再超分是省显存的常见路线。
- 关键参数:FlashVSR 解码器加载后串在 VAE 解码环节(FlashVSR/flashvsr_nodes.py)。
- 易踩坑:超分前就堆高 CFG,会放大纹理噪点,先定画面再放大。
姿态控制
- 适用场景:指定人物动作轨迹,做舞蹈、运动镜头。
- 关键参数:SCAIL、SteadyDancer、MTV 等节点组各自吃骨骼序列;WanMove 吃轨迹点云。
- 易踩坑:姿态序列和帧数对不上时按 4n+1 补帧,别裁掉原视频节奏。
4. 做出来:两个可复现案例
案例 1:玩具 360° 展示视频——一次翻车后的调整
第一次跑 720x720、121 帧,结果主体转体时耳朵和花茎糊成一片。问题不在模型,在两处参数:
- 帧数降回 81(5 秒 @16fps):帧数越多,运动一致性越难保,产品展示 5 秒足够,121 帧纯属给自己加难度;
- CFG 从 8 降到 6.0:高引导强度放大了背景噪点,旋转中花瓣边缘开始闪烁,回到默认 6.0 后闪烁消失。
调整后同一套 512x512→超分 720p 的流程出片干净。产品类画面记住一条:低 CFG + 中等步数(30)+ 后期超分,比一步到位的高分辨率更稳。
案例 2:5 秒人物肖像视频——参数为什么这么设
参数照抄这组,每个值都有来由:
| 参数 | 取值 | 为什么 |
|---|---|---|
| 分辨率 | 512x512 | VAE 压缩步长 (4,8,8),512 能被 8 整除,无补边损失 |
| 帧数 | 81(5 秒) | 4n+1 规则 + 16fps,正好 5 秒 |
| 步数 | 30 | 默认值,表情类小幅度运动不需要 50 步 |
| CFG | 6.0 | 提示词只描述一个表情变化,高 CFG 会过饱和 |
| 调度器 | unipc | 默认调度器,小幅度运动下最不容易跳帧 |
表情变化幅度不满意时,先动提示词里的"动作描述",其次才动 cfg——步数在这个量级里收益很小。
5. 调优与避坑:显存、速度、质量三角
三者只能同时占两个,你的选择顺序应该是:先保显存不爆,再挑速度,质量最后补。
- 显存不够:优先换 FP8 缩放权重,其次开块交换(
blocks_to_swap每加 2 块约多换出 0.5GB 量级),最后才降分辨率。LoRA 不参与合并时也会占显存,显存紧张就把 LoRA 合并进模型。 - 速度不够:开 Teacache,阈值 0.25–0.30 是作者给出的可用区间,阈值越激进跳步越多,早期跳步容易毁掉运动,可以让起始步晚一点。
- 质量不够:步数从 30 往上调收益有限,先检查 CFG 和提示词;纹理细节交给超分节点,别用分辨率硬扛。
💡 Windows 用户遇到"第一次跑新分辨率显存暴涨、第二次又正常",是 Triton 编译缓存的已知问题,删掉C:\Users\<用户名>\.triton和AppData\Local\Temp\torchinductor_<用户名>两个目录再跑。
故障速查表
| 现象 | 先查这里 |
|---|---|
| 加载报量化档位不匹配 | 权重是 scaled 版却选了非 scaled 档位(或反之),两者必须一一对应 |
| 块交换与 VRAM 管理同时开 | 二者互斥,只能启用其中一个 |
| 首帧变形、主体漂移 | 输入图比例与目标分辨率不一致,先 resize 再进 I2V |
| 运动抽搐、跳帧 | Teacache 阈值过低或起始步太早,阈值提到 0.30 并推迟 start step |
| 面部崩坏 | 换更高质量首帧、降分辨率重试;姿态类工作流检查关键点序列长度 |
| 出片帧率看着快 | 16fps 是模型默认采样帧率,导出时再倍速,不是节点 bug |
节点功能还在持续扩充,新模型支持以仓库更新为准。
现在就重启 ComfyUI,把 1.3B 模型的最小档工作流跑一遍。出片后对照第 5 节的三角表调一次显存档位。你的第一段视频,30 分钟就能有。
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考