ComfyUI视频生成完全指南:用ComfyUI-WanVideoWrapper让14B模型跑进低显存
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
ComfyUI-WanVideoWrapper 是一个面向 WanVideo 系列视频生成模型的 ComfyUI 视频生成插件,它把 140 亿参数的视频扩散模型封装成一组可拖拽、可组合的 ComfyUI 节点。它要解决的核心痛点是显存——通过 block swap(把模型不用的层临时挪到内存、用时再取回,即 offloading)和 fp8 量化推理,让原本需要更大显存的 14B 模型在 16GB 级别的显卡上跑起来。如果你想用中端显卡实打实地做出文生视频、图生视频,这个插件是目前最实用的选择之一。
✅ 它到底能做什么:4 种典型输入输出组合
先建立直觉,这个项目覆盖的玩法可以概括为四种「输入什么 → 输出什么」:
- 文生视频:输入一句 prompt,输出一段描述场景的短视频,是最基础的链路。
- 图生视频:输入一张参考图(比如下面的角色图)加文字描述,输出以这张图为首帧展开的视频。
- 音频驱动:Ovi 节点组支持输入图像 + 音频,输出带口型和声音的视频。
- 镜头控制:接入 ReCamMaster、Uni3C 等扩展后,输入素材与控制参数,输出指定运镜的视频。
🧩 底层是怎么跑的(简化版):模块化流水线 + 显存优化
一条五段式流水线:从 prompt 到视频文件
整个生成过程就是五段接力,每段对应一类节点:
prompt/参考图 → T5 与 CLIP 编码 → 空 latent 准备 → 扩散采样 → VAE 解码 → 视频输出
具体对应关系是:T5(umt5_xxl)和 CLIP Vision 负责把文字和图片变成模型能读的特征;WanVideoEmptyEmbeds创建待生成的噪声 latent;WanVideoSampler驱动 14B Transformer 迭代去噪,采样器可在 wanvideo/schedulers/ 里选的 FlowMatch、ERSDE 等之间切换;WanVideoDecode用 VAE 把 latent 还原成像素视频;最后由 VHS_VideoCombine 节点落盘。
block swap 是怎么把 14B 模型塞进 16GB 显存的
这里有个关键细节:Wan 14B 的 Transformer 主干约 40 个 block。block swap 的做法是只把当前要用的 block 留在显存,其余挪到系统内存,并在计算间隙异步预取下一个 block——计算和搬运并行,所以速度损失不大。显存不够时还有两招:fp8 量化把参数体积减半(作者个人推荐 fp8 scaled 版本权重),GGUF 格式则支持更低的量化档位,主模型加载器可直接加载.gguf文件。
下面这段来自 nodes.py 的代码,作用只是把「换入换出哪些 block」的配置挂到模型选项上,真正的搬运发生在推理过程中:
def loadmodel(self, model, block_swap_args=None): if block_swap_args is None: return (model,) patcher = model.clone() if 'transformer_options' not in patcher.model_options: patcher.model_options['transformer_options'] = {} patcher.model_options["transformer_options"]["block_swap_args"] = block_swap_args return (patcher,)🚀 从 0 到跑起来的实操路径
硬件门槛:显存到底要多少
下面这张表整理自仓库 readme 中的实测数据点,可作为 8GB 显存跑 14B 模型之类问题的最小配置参考:
| 显存档位 | 最小可行配置 | 依据 |
|---|---|---|
| 约 5GB | 1.3B T2V 模型 + 81 帧窗口 | readme 实测:1025 帧长视频用不到 5GB,5090 上约 10 分钟 |
| 8–16GB | 14B fp8/GGUF + block swap 卸载 | readme 实测:512x512x81、20/40 block 卸载,约 16GB |
| 16–24GB | 14B fp8,减少卸载比例提速 | fp8 权重 + 按需调整卸载 block 数 |
| 24GB+ | 14B 高精度权重,可不卸载 | 全量驻留显存,速度最快 |
环境准备:clone 插件 + 两步装依赖
在 ComfyUI 的custom_nodes目录下执行:
git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper pip install -r ComfyUI-WanVideoWrapper/requirements.txt如果你用的是 ComfyUI 便携版,改用便携版自带的python_embeded\python.exe -m pip install安装同一份 requirements.txt 即可。
模型下载:4 类文件放进 4 个目录
| 组件 | 放置目录 | 备注 |
|---|---|---|
| T5 文本编码器 umt5_xxl | ComfyUI/models/text_encoders | 也可复用 ComfyUI 原生加载器 |
| CLIP Vision | ComfyUI/models/clip_vision | 同上 |
| 主干视频模型 | ComfyUI/models/diffusion_models | 推荐 fp8 scaled 版本;支持 GGUF |
| VAE | ComfyUI/models/vae |
模型下载地址以 readme 为准,按上面的目录摆放即可。
跑通第一条文生视频工作流
- 在 ComfyUI 里导入 example_workflows/wanvideo_2_1_14B_T2V_example_03.json;
- 把模型加载器指向刚下载的文件;
- 在 WanVideoSetBlockSwap 节点按你的显存档位设置卸载 block 数;
- 点 Queue Prompt,等 VHS_VideoCombine 输出视频。
🎛️ 进阶玩法与生态
怎么写一个自己的 WanVideo 节点
一个节点就是一个类:声明INPUT_TYPES(输入端口)、RETURN_TYPES(输出端口)和FUNCTION(执行方法),最后注册进NODE_CLASS_MAPPINGS字典即可。仓库 nodes.py 里有几十个现成样例可照着抄,比如最简单的 WanVideoEnhanceAVideo 只接收三个 float 参数。
40 多份现成工作流模板
example_workflows/ 目录下有 40 多份 JSON,覆盖 T2V、I2V、Ovi 音频驱动、Fun control 运镜、VACE、WanAnimate 等场景,导入即用,是学习节点连法最快的方式。
跑起来之后值得试的加速项
- 注意力实现:加载器里可选 sdpa、flash_attn_2/3、sageattn、radial 稀疏注意力等,显存紧张时优先后几档;
- 缓存节点:TeaCache / MagCache / EasyCache 三个节点,按 readme 提示调整阈值(新版系数阈值约为旧版 10 倍);
- 上下文窗口:用滑动窗口 + 重叠生成超长视频,readme 的 1025 帧案例就是 81 帧窗口加 16 帧重叠跑出来的。
⚖️ 值不值得现在上手
优势一:显存优化是真正的硬实力,block swap + fp8/GGUF 有 readme 实测数据背书,中端卡跑 14B 不是噱头。优势二:生态覆盖广,据仓库 readme 描述,除 Wan 本体外还集成了 SkyReels、VACE、ReCamMaster、FantasyTalking、WanAnimate、ATI 等 20 多个扩展模型与免训练技巧,一个插件顶好几个。优势三:上手成本低,40 多份工作流模板导入即跑,节点连法有参考可抄。
局限也要说清楚:作者在 readme 中自述这是「永远在途」(perpetual WIP)的个人沙盒,并明确建议——如果 ComfyUI 原生已支持相同模型和功能,优先用原生节点;插件更新快,旧工作流的显存参数(尤其是未合并 LoRA 占用 block 之后的 block swap 配置)可能需要重新调。
所以判断很简单:显卡 8GB 以上、想第一时间玩 Wan 生态的新模型新玩法,现在就值得上手;如果只想要最稳的基础链路,先确认原生 ComfyUI 的支持情况再决定。
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考