☰
一张图变动态视频:minimax-h3-int8 图生视频(I2V)实战指南
2026/9/29 21:24:35 网站建设 项目流程

一张图变动态视频:minimax-h3-int8 图生视频(I2V)实战指南

【免费下载链接】minimax-h3-int8项目地址: https://ai.gitcode.com/xujiashuai/minimax-h3-int8

minimax-h3-int8 是一个专为 Ascend 910 NPU 适配的 MiniMax H3 INT8 量化视频生成仓库,内置 ComfyUI 与全套权重,支持文生视频与图生视频(I2V)。本文是一份面向新手的最小可行指南:只需准备一张图片,加上几句运镜描述,就能在 NPU 上生成约 5 秒、1344×768 分辨率、带音效的 MP4 动态视频。

一、为什么用 minimax-h3-int8 做图生视频?

  • 🎯全链路 NPU:文本编码器、扩散模型、视频/音频 VAE 全部跑在昇腾 NPU 上,双卡(2× Ascend910 64G)实测最快 76 秒出片(含模型加载)
  • 🖼️图生视频(I2V):MiniMaxH3ImageToVideo节点支持"首帧图"输入,你提供的图片会成为视频的第一帧并锚定整个画面
  • 🎵音视频一体:一次推理同时输出视频轨 + 音频轨,提示词里加一段Audio:描述即可生成配乐音效
  • 📦一键部署:代码 + 权重 + ComfyUI 同仓分发,clone 即得(权重经 Git LFS 自动携带)
组件权重文件精度设备
文本编码器models/qwen3vl_32b_minimax_h3_int8_convrot.safetensorsINT8 ConvRotnpu:1
扩散模型models/minimax_h3_fl2va_pruned_int8_convrot.safetensorsINT8 ConvRotnpu:0
视频 VAEmodels/minimax_h3_video_vae_fp16.safetensorsFP16npu:0
音频 VAEmodels/minimax_h3_audio_vae_fp32.safetensorsFP32npu:0

二、图生视频(I2V)是怎么工作的?

I2V 推理与文生视频(T2V)共用一条链路,区别只在输入端多了一张首帧图:

首帧图 (你的图片) ──> LoadImage ──> MiniMaxH3ImageToVideo.first_frame │ 提示词 prompt ──> CLIPLoader (npu:1) ──> 条件向量 │ 噪声 ──> 扩散采样 (DiT INT8, npu:0, 8/20 步) ──> 隐空间视频帧 │ VAEDecode(像素帧)+ VAEDecodeAudio(音频轨) │ CreateVideo (24fps) ──> SaveVideo ──> output/video/*.mp4

四个阶段一览:

阶段节点输入 → 输出设备
① 文本编码CLIPLoaderprompt → 条件向量npu:1
② 扩散采样SamplerCustomAdvanced条件 + 噪声 + 首帧 → 隐空间视频帧npu:0
③ VAE 解码VAEDecode+VAEDecodeAudio隐空间 → 像素帧 / 音频轨npu:0
④ 视频合成CreateVideo+SaveVideo帧 + 音频 → MP4CPU

完整链路详解见 docs/video-generation-pipeline.md。

三、首帧图要求:一张合格的"种子图"

图片质量直接决定成片质量。以下规范全部经过实测验证(来自 docs/t2i-i2v-pipeline.md):

项规范理由
格式PNG(首选)/ JPGPNG 无损;JPG 体积更小但有压缩损失
尺寸1344 × 768(与视频输出一致)避免模型内部缩放/裁切导致构图偏移
对齐宽高为16 的倍数VAE/采样要求对齐(1344=84×16, 768=48×16 ✅)
色彩RGB,无透明通道视频编码不支持 alpha
内容无文字 / 水印 / logo / 字幕否则会被"印"进视频每一帧

💡 小贴士:ComfyUI 的LoadImage节点接受 png / jpg / jpeg / webp / gif / bmp / avif / tiff;若图片是方图(如 1024×1024),建议先中心裁剪到 1344×768 横屏,再作为首帧。

四、快速上手:三种方式生成 I2V 视频

方式 1:ComfyUI 网页界面拖图(最推荐新手 🖱️)

CREATIVE-GUIDE.md 官方推荐的入门方式:

  1. 启动服务:./scripts/start-comfyui-dual-npu.sh start(默认端口 8188)
  2. 浏览器打开http://<服务器IP>:8188
  3. 加载 workflows/ 下的api_t2v_int8_turbo.json,在MiniMaxH3ImageToVideo节点拖入你的首帧图,写一段运镜提示词,点击 Queue Prompt

比 API 方便,所见即所得。

方式 2:创作脚本一键出片(适合批量)🚀

配套的创作仓库h3-video-creations提供一行命令入口(详见 README.md「开始创作」一节):

./scripts/create.sh --image ~/my.png --text "camera pushes forward" # 图生视频

脚本会自动把图片上传到 ComfyUI input 目录,经LoadImage → MiniMaxH3ImageToVideo.first_frame链路生成视频。

方式 3:API 提交(适合自动化)🔧

按 docs/usage.md 的步骤,把工作流 JSON POST 给 ComfyUI 的/prompt接口即可,MiniMaxH3ImageToVideo节点挂上首帧图路径,其余参数照抄 workflows/api_t2v_int8_turbo.json。

五、关键参数设置与提示词写法

分辨率不是随便填的,共有 5 层限制(节点 step、VAE 对齐、patch、训练分布、显存),完整边界见 docs/video-resolution-guide.md。推荐配置速查:

场景widthheightlength说明
默认(质量)1344768124官方 768p 原生最优,峰值显存 42.7G(有余量)
速度优先1024576124像素减半,快约 2 倍
竖屏7681344124短边 768,适合短视频平台

I2V 提示词怎么写?图片已经定好了"画面是什么",提示词应聚焦**"怎么动"**:

  • 结构:运镜方式 + 主体动作 + 环境氛围,例如camera glides forward along a reflective street, gentle rain, cinematic
  • 想要清晰:加sharp focus, highly detailed;避免soft / mist / bokeh等柔焦词(实测是模糊主因)
  • 配乐音效:末尾加Audio: gentle rain, distant tram bell这类描述
  • 负面约束:用No text, logos, subtitles or watermark收尾

更多灵感示例见 CREATIVE-GUIDE.md 末尾。

六、进阶:文生图 → 审核 → 图生视频两段式管线 💎

如果你还没有现成的图片,仓库内置了「先 T2I 出首帧图 → 人工审核 → I2V 出视频」的两段式管线方案(docs/t2i-i2v-pipeline.md,详细设计见 docs/t2i-i2v-pipeline-design.md):

T2I 文生图 ──> 图片审核关卡 ──> I2V 图生视频 ──> 视频交付 出首帧 PNG 内容/质量/尺寸 首帧锚定动态 output/video

核心思路是把图片作为可重复使用的资产:审核通过后存档,同一张图可以反复生成不同运镜、不同批次的视频,保证系列作品画面一致——这正是 I2V 相对"直接文生视频"的本质优势。

七、常见问题排查

症状原因处理
报 "not divisible"首帧图/分辨率不是 16 或 32 倍数裁剪/缩放到 32 倍数尺寸
OOM 显存溢出分辨率或帧数过高降到 1024×576 或减length
画面糊分辨率远低于 768 短边提到 1344×768(短边 ≥768)
首帧构图跑偏图片比例与视频比例不一致先裁剪成 16:9 横屏再上传
视频里出现文字水印首帧图本身带文字换干净底图,提示词加负面约束
INT8 未生效(速度骤降)NPU patch 未打上重跑./scripts/setup_comfyui.sh --patches

⏱️ 耗时参考(双卡 NPU 实测):冷启动首次约 3 分钟;热启动 8 步 124 帧约 1~2 分钟。质量优先可切 20 步的 workflows/api_t2v_int8_dual.json。

八、延伸阅读

文档内容
README.md一键部署、工作流选择、目录结构总览
docs/usage.md输入/输出数据说明与 API 调用步骤
docs/dual-npu-deployment.md双卡拆分的动机与性能预期
docs/video-resolution-guide.md分辨率 5 层限制边界与配置方法
CREATIVE-GUIDE.md提示词模板、参数速查、灵感示例

准备好一张 1344×768 的干净首帧图,写一句运镜描述,剩下的交给 NPU——你的第一支 AI 动态视频几分钟即可出炉 🎬

【免费下载链接】minimax-h3-int8项目地址: https://ai.gitcode.com/xujiashuai/minimax-h3-int8

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询