ComfyUI-WanVideoWrapper:一个节点集合跑通 Wan 文生视频、图生视频与长视频续写
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
ComfyUI-WanVideoWrapper 是面向 Wan 系列视频生成模型的 ComfyUI 自定义节点集,把 Wan 文生视频、图生视频、口型驱动、长视频续写等工作流整合进 ComfyUI 图内操作。它适合已有 ComfyUI 环境、想快速试用新版 Wan 模型功能的用户,省去自行处理模型加载、显存卸载和缓存加速的逻辑。
example_workflows/目录中的示例输入(1280×720 男性人像),可直接作为图生视频首帧。
一、它解决哪些任务
仓库里的节点都是围绕几件具体的"想做的事"组织的,每项都有配套节点和示例工作流可对照:
| 任务 | 所需输入 | 产出 |
|---|---|---|
| 文生视频 | 正向/负向提示词 | 81 帧短视频 |
| 图生视频 | 首帧图片 + 运动描述 | 延续该画面构图与光影的视频 |
| 音频驱动口型 | 人物图 + 音频文件 | 口型同步动画(FantasyTalking、MultiTalk 等节点组) |
| 长视频续写 | 首帧或上一段视频 | 1025 帧以上的长视频(context window 分窗拼接) |
| 运动/运镜控制 | 视频或图片 + 控制信号(姿态、相机轨迹等) | 复现原运动或重打光的新视频(ReCamMaster、WanMove 等) |
对应的工作流都在 example_workflows/ 目录,文件按场景命名,找起点不费劲。
二、环境搭建与模型就位
Wrapper 直接运行在 ComfyUI 的 Python 环境里,无需另建虚拟环境;Windows 便携版用包内python_embeded\python.exe装依赖即可。显存参考仓库实测数据:1.3B 模型开 context window 全程不到 5GB,14B 在 512×512、81 帧时卸载 20 个 block 约 16GB,8GB 显卡靠卸载也能跑,16GB 以上更从容。
cd ComfyUI/custom_nodes git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper pip install -r ComfyUI-WanVideoWrapper/requirements.txt克隆进custom_nodes是因为 ComfyUI 启动时自动扫描该目录注册节点包;__init__.py里还有重复目录检测,同一份仓库放两处会报冲突警告,保持单份即可。
模型文件按 ComfyUI 惯例放四个目录,作者建议直接选 fp8 scaled 量化权重(体积与显存都更省,GGUF 权重主模型加载节点也支持):
| 目录 | 内容 | 为什么放这里 |
|---|---|---|
ComfyUI/models/diffusion_models | Wan Transformer 主权重 | 核心生成模型,由主模型加载节点从这里扫描 |
ComfyUI/models/text_encoders | T5 文本编码器 | 文生视频提示词靠它编码 |
ComfyUI/models/clip_vision | CLIP Vision | 图生视频流程用它编码首帧图像 |
ComfyUI/models/vae | VAE | 视频帧的编码与解码,缺它无法出图 |
三、三类高频创作实操
实操一:文生视频,从提示词到 5 秒短片
- 目标:纯文字描述生成可控质量的短片。先用 1.3B 模型验证流程,确认效果后再换 14B 出正式版,省时间也省显存。
- 输入:正向与负向提示词、种子,不需要图片。
- 关键参数:分辨率从 512×512 起步,长度 81 帧;模型加载节点里打开 block swap,14B 模型多卸载一些 block 留出余量。
- 常见坑:Windows 首次运行显存异常高、再跑就正常,多为 triton 旧缓存所致,清缓存重跑即可;提示词只写"一个人在跳舞",运动稳定性明显差于写清主体、动作、环境。
实操二:图生视频,让一张人像动起来
- 目标:以单张图片为首帧,生成延续其构图和光影的视频,适合人物动画和产品展示。
- 输入:一张较清晰的人像图(面部清晰最好),外加描述运动的文字;CLIP Vision 负责编码图像。
- 关键参数:视频分辨率与图片长宽比保持一致;主权重用 fp8 scaled 版可明显降低显存峰值。
- 常见坑:源图分辨率低会直接拖垮结果清晰度;只想要主体微动时,提示词要写明"轻微动作",否则镜头会自行漂移。
仓库中 1024×1024 的人像示例输入,可直接用作 I2V 首帧。
实操三:长视频续写,把 5 秒片段接成长片
- 目标:突破单次 81 帧的限制,生成分钟级长视频。
- 输入:首帧(或上一段生成结果的尾段)加上 context window 节点。
- 关键参数:仓库实测配置为每窗 81 帧、重叠 16 帧;1.3B T2V 模型生成 1025 帧全程显存不到 5GB,5090 上约 10 分钟。
- 常见坑:重叠帧给少了,段落交界处会出现接缝;给多了则生成变慢、显存吃紧,16 帧是仓库验证过的中间值。
四、参数速查与排障
| 项 | 建议值 | 依据 |
|---|---|---|
| 生成长度 | 81 帧 | 仓库实测使用的标准长度 |
| 起步分辨率 | 512×512 | 14B 在该规格下卸载 20/40 block 约 16GB |
| 长视频窗口 | 每窗 81 帧、重叠 16 帧 | 1.3B 实测 1025 帧显存不到 5GB |
| TeaCache 阈值 | 0.25–0.30 | 过激会跳步,破坏前期运动 |
| 显存策略 | block swap + fp8 权重 | 未合并 LoRA 计入 block 体积,卸载时需多补几块 |
遇到异常时按症状对照处理:
| 症状 | 原因 | 处理 |
|---|---|---|
| 加载或生成时 OOM | 14B 权重全部驻留显存 | 打开 block swap 增加卸载数,或换 fp8 scaled 权重 |
| Windows 首跑显存暴涨,再跑恢复正常 | torch.compile / triton 旧缓存 | 清理.triton与 torchinductor 临时目录后重跑 |
| 结果模糊、运动不到位 | 步数偏低或提示词过抽象 | 提高采样步数,提示词写清主体、动作、场景 |
| 用了 LoRA 后显存异常偏高 | 未合并 LoRA 作为模块 buffer 占用显存 | 每 1GB LoRA 大约多卸载 2~3 个 block 补偿 |
五、进阶:扩展与二开
第三方模型兼容度是选用这个 wrapper 的主要理由:仓库自带 SkyReels、ReCamMaster、VACE、Phantom、ATI、Uni3C、MultiTalk、EchoShot、Stand-In、HuMo、WanAnimate、Lynx、MoCha、UniLumos、FantasyTalking、LongCat-Video、FlashVSR、Ovi 等节点组,其中部分(如 ATI)是 patcher 式节点,还能注入原生 ComfyUI 工作流。
自定义节点的切入点很清晰:init.py 集中注册必需模块(主节点、采样器、模型加载、工具、缓存)与可选模块(导入失败仅告警),每个模块对外暴露NODE_CLASS_MAPPINGS。最小自定义节点如下:
class MyModelNode: @classmethod def INPUT_TYPES(cls): return {"required": {"model": ("MODEL",)}} RETURN_TYPES = ("MODEL",) FUNCTION = "run" def run(self, model): return (model,) NODE_CLASS_MAPPINGS = {"MyModelNode": MyModelNode}先克隆仓库并放好 fp8 scaled 的 1.3B 权重,再从 example_workflows/ 里加载一个文生视频工作流,把 512×512、81 帧跑通一遍。
关键词:ComfyUI-WanVideoWrapper、WanVideo ComfyUI 节点、Wan 文生视频教程、Wan 图生视频工作流、ComfyUI 低显存视频生成、长视频 context window
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考