一张图变动态视频:minimax-h3-int8 图生视频(I2V)实战指南
【免费下载链接】minimax-h3-int8项目地址: https://ai.gitcode.com/xujiashuai/minimax-h3-int8
minimax-h3-int8 是一个专为 Ascend 910 NPU 适配的 MiniMax H3 INT8 量化视频生成仓库,内置 ComfyUI 与全套权重,支持文生视频与图生视频(I2V)。本文是一份面向新手的最小可行指南:只需准备一张图片,加上几句运镜描述,就能在 NPU 上生成约 5 秒、1344×768 分辨率、带音效的 MP4 动态视频。
一、为什么用 minimax-h3-int8 做图生视频?
- 🎯全链路 NPU:文本编码器、扩散模型、视频/音频 VAE 全部跑在昇腾 NPU 上,双卡(2× Ascend910 64G)实测最快 76 秒出片(含模型加载)
- 🖼️图生视频(I2V):
MiniMaxH3ImageToVideo节点支持"首帧图"输入,你提供的图片会成为视频的第一帧并锚定整个画面 - 🎵音视频一体:一次推理同时输出视频轨 + 音频轨,提示词里加一段
Audio:描述即可生成配乐音效 - 📦一键部署:代码 + 权重 + ComfyUI 同仓分发,clone 即得(权重经 Git LFS 自动携带)
| 组件 | 权重文件 | 精度 | 设备 |
|---|---|---|---|
| 文本编码器 | models/qwen3vl_32b_minimax_h3_int8_convrot.safetensors | INT8 ConvRot | npu:1 |
| 扩散模型 | models/minimax_h3_fl2va_pruned_int8_convrot.safetensors | INT8 ConvRot | npu:0 |
| 视频 VAE | models/minimax_h3_video_vae_fp16.safetensors | FP16 | npu:0 |
| 音频 VAE | models/minimax_h3_audio_vae_fp32.safetensors | FP32 | npu:0 |
二、图生视频(I2V)是怎么工作的?
I2V 推理与文生视频(T2V)共用一条链路,区别只在输入端多了一张首帧图:
首帧图 (你的图片) ──> LoadImage ──> MiniMaxH3ImageToVideo.first_frame │ 提示词 prompt ──> CLIPLoader (npu:1) ──> 条件向量 │ 噪声 ──> 扩散采样 (DiT INT8, npu:0, 8/20 步) ──> 隐空间视频帧 │ VAEDecode(像素帧)+ VAEDecodeAudio(音频轨) │ CreateVideo (24fps) ──> SaveVideo ──> output/video/*.mp4四个阶段一览:
| 阶段 | 节点 | 输入 → 输出 | 设备 |
|---|---|---|---|
| ① 文本编码 | CLIPLoader | prompt → 条件向量 | npu:1 |
| ② 扩散采样 | SamplerCustomAdvanced | 条件 + 噪声 + 首帧 → 隐空间视频帧 | npu:0 |
| ③ VAE 解码 | VAEDecode+VAEDecodeAudio | 隐空间 → 像素帧 / 音频轨 | npu:0 |
| ④ 视频合成 | CreateVideo+SaveVideo | 帧 + 音频 → MP4 | CPU |
完整链路详解见 docs/video-generation-pipeline.md。
三、首帧图要求:一张合格的"种子图"
图片质量直接决定成片质量。以下规范全部经过实测验证(来自 docs/t2i-i2v-pipeline.md):
| 项 | 规范 | 理由 |
|---|---|---|
| 格式 | PNG(首选)/ JPG | PNG 无损;JPG 体积更小但有压缩损失 |
| 尺寸 | 1344 × 768(与视频输出一致) | 避免模型内部缩放/裁切导致构图偏移 |
| 对齐 | 宽高为16 的倍数 | VAE/采样要求对齐(1344=84×16, 768=48×16 ✅) |
| 色彩 | RGB,无透明通道 | 视频编码不支持 alpha |
| 内容 | 无文字 / 水印 / logo / 字幕 | 否则会被"印"进视频每一帧 |
💡 小贴士:ComfyUI 的
LoadImage节点接受 png / jpg / jpeg / webp / gif / bmp / avif / tiff;若图片是方图(如 1024×1024),建议先中心裁剪到 1344×768 横屏,再作为首帧。
四、快速上手:三种方式生成 I2V 视频
方式 1:ComfyUI 网页界面拖图(最推荐新手 🖱️)
CREATIVE-GUIDE.md 官方推荐的入门方式:
- 启动服务:
./scripts/start-comfyui-dual-npu.sh start(默认端口 8188) - 浏览器打开
http://<服务器IP>:8188 - 加载 workflows/ 下的
api_t2v_int8_turbo.json,在MiniMaxH3ImageToVideo节点拖入你的首帧图,写一段运镜提示词,点击 Queue Prompt
比 API 方便,所见即所得。
方式 2:创作脚本一键出片(适合批量)🚀
配套的创作仓库h3-video-creations提供一行命令入口(详见 README.md「开始创作」一节):
./scripts/create.sh --image ~/my.png --text "camera pushes forward" # 图生视频脚本会自动把图片上传到 ComfyUI input 目录,经LoadImage → MiniMaxH3ImageToVideo.first_frame链路生成视频。
方式 3:API 提交(适合自动化)🔧
按 docs/usage.md 的步骤,把工作流 JSON POST 给 ComfyUI 的/prompt接口即可,MiniMaxH3ImageToVideo节点挂上首帧图路径,其余参数照抄 workflows/api_t2v_int8_turbo.json。
五、关键参数设置与提示词写法
分辨率不是随便填的,共有 5 层限制(节点 step、VAE 对齐、patch、训练分布、显存),完整边界见 docs/video-resolution-guide.md。推荐配置速查:
| 场景 | width | height | length | 说明 |
|---|---|---|---|---|
| 默认(质量) | 1344 | 768 | 124 | 官方 768p 原生最优,峰值显存 42.7G(有余量) |
| 速度优先 | 1024 | 576 | 124 | 像素减半,快约 2 倍 |
| 竖屏 | 768 | 1344 | 124 | 短边 768,适合短视频平台 |
I2V 提示词怎么写?图片已经定好了"画面是什么",提示词应聚焦**"怎么动"**:
- 结构:运镜方式 + 主体动作 + 环境氛围,例如
camera glides forward along a reflective street, gentle rain, cinematic - 想要清晰:加
sharp focus, highly detailed;避免soft / mist / bokeh等柔焦词(实测是模糊主因) - 配乐音效:末尾加
Audio: gentle rain, distant tram bell这类描述 - 负面约束:用
No text, logos, subtitles or watermark收尾
更多灵感示例见 CREATIVE-GUIDE.md 末尾。
六、进阶:文生图 → 审核 → 图生视频两段式管线 💎
如果你还没有现成的图片,仓库内置了「先 T2I 出首帧图 → 人工审核 → I2V 出视频」的两段式管线方案(docs/t2i-i2v-pipeline.md,详细设计见 docs/t2i-i2v-pipeline-design.md):
T2I 文生图 ──> 图片审核关卡 ──> I2V 图生视频 ──> 视频交付 出首帧 PNG 内容/质量/尺寸 首帧锚定动态 output/video核心思路是把图片作为可重复使用的资产:审核通过后存档,同一张图可以反复生成不同运镜、不同批次的视频,保证系列作品画面一致——这正是 I2V 相对"直接文生视频"的本质优势。
七、常见问题排查
| 症状 | 原因 | 处理 |
|---|---|---|
| 报 "not divisible" | 首帧图/分辨率不是 16 或 32 倍数 | 裁剪/缩放到 32 倍数尺寸 |
| OOM 显存溢出 | 分辨率或帧数过高 | 降到 1024×576 或减length |
| 画面糊 | 分辨率远低于 768 短边 | 提到 1344×768(短边 ≥768) |
| 首帧构图跑偏 | 图片比例与视频比例不一致 | 先裁剪成 16:9 横屏再上传 |
| 视频里出现文字水印 | 首帧图本身带文字 | 换干净底图,提示词加负面约束 |
| INT8 未生效(速度骤降) | NPU patch 未打上 | 重跑./scripts/setup_comfyui.sh --patches |
⏱️ 耗时参考(双卡 NPU 实测):冷启动首次约 3 分钟;热启动 8 步 124 帧约 1~2 分钟。质量优先可切 20 步的 workflows/api_t2v_int8_dual.json。
八、延伸阅读
| 文档 | 内容 |
|---|---|
| README.md | 一键部署、工作流选择、目录结构总览 |
| docs/usage.md | 输入/输出数据说明与 API 调用步骤 |
| docs/dual-npu-deployment.md | 双卡拆分的动机与性能预期 |
| docs/video-resolution-guide.md | 分辨率 5 层限制边界与配置方法 |
| CREATIVE-GUIDE.md | 提示词模板、参数速查、灵感示例 |
准备好一张 1344×768 的干净首帧图,写一句运镜描述,剩下的交给 NPU——你的第一支 AI 动态视频几分钟即可出炉 🎬
【免费下载链接】minimax-h3-int8项目地址: https://ai.gitcode.com/xujiashuai/minimax-h3-int8
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考