16GB 显卡跑 2K 带声音视频:MiniMax H3 量化模型本地部署完整指南
【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
Minimax-H3-nvfp4-INT4-INT8-Convrot 把 MiniMax H3(海螺 3.0)视频生成模型的 INT4 / INT8 / NVFP4 量化权重整理进了同一个仓库,目标只有一个:让你用 16GB–24GB 显存的消费级显卡,在 ComfyUI 里本地生成 2K 分辨率、自带立体声音频、最长 15 秒的视频,而不用租大显存云卡。下面按"能输出什么 → 该下载什么 → 怎么跑起来"的顺序讲清楚。
🎬 先看懂它能输出什么
这条管线和你常见的文生视频工具最大的区别是音画同出:视频和立体声音频由同一个 Transformer 联合预测,对白还能跨 11 种语言(中、英、日、韩、法、德、西、俄、葡、意、阿拉伯语),你可以直接用母语写提示词。
| 输出项 | 规格 |
|---|---|
| 时长 | 4–15 秒 |
| 分辨率 | 短边默认 768px;2K 生成需配合 H3-Regenerate-2K |
| 帧率 | 24 FPS |
| 画幅 | 21:9、16:9、4:3、1:1、3:4、9:16 等多种比例 |
| 音频 | 32 kHz 立体声 |
输入侧分两个系列,文件名前缀不同,按需选择即可:
| 系列 | 输入方式 | 参考上限 |
|---|---|---|
| FL2VA | 0/1/2 张图:纯文本生视频、首帧或尾帧图生视频、首尾帧控制 | — |
| Ref2VA | 多模态参考输入:图像 + 视频片段 + 音频 | 图 ≤9 张;视频 ≤3 段(每段 2–15 秒,总长 ≤15 秒);音频 ≤3 段(必须搭配图/视频,不能单独作为输入);文件总数 ≤12 |
只想要"文字变视频"就选 FL2VA;手里有多张参考图、片段或想混入音频,才需要 Ref2VA。
🧮 显存对号入座:五种量化文件怎么选
量化就是用少量画质换取数倍显存。这个仓库的好处是同一模型的各档量化都齐了,你只需要看自己的显卡是哪一档:
扩散模型(文件名中段区分系列)
| 文件后缀 | 显存需求 | 适合的显卡 |
|---|---|---|
_pruned_int4_convrot | 约 11.3 GB | 16GB(如 4070 Ti Super、4080),入门首选 |
_pruned_mixed_int4_int8_convrot | 约 15.5 GB | 16GB 且想留一点余量、画质比纯 INT4 好 |
_pruned_int8_convrot | 约 21 GB | 24GB(3090、4090),剪枝版里质量最高 |
_pruned_nvfp4(12.5 GB)/_nvfp4_mixed(24.4 GB) | 12.5–24.4 GB | 仅限 Blackwell 架构(RTX 5090、PRO 6000 等),30/40 系显卡不要下载 |
文本编码器(Qwen3-VL-32B,必须和显卡档位配套)
| 文件 | 大小 | 配套显卡 |
|---|---|---|
qwen3vl_32b_minimax_h3_int4_convrot.safetensors | 15.0 GB | 16GB |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 27.1 GB | 24GB |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15.7 GB | Blackwell |
VAE 解码器(谁都必须下,共两个文件)
vae/minimax_h3_audio_vae_fp32.safetensors(605 MB)vae/minimax_h3_video_vae_fp16.safetensors(5.21 GB)
漏掉音频 VAE 的常见后果就是:视频正常出来,但声音是空的。
🛠️ 三步把模型跑进 ComfyUI
第 1 步,克隆仓库。大权重文件走 git-lfs 拉取,机器上需要先装好 git-lfs,否则拿到的只是几百字节的指针文件:
git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot第 2 步,按上面的表挑 4 个文件:1 个扩散模型 + 1 个配套的文本编码器 + 2 个 VAE,分别放进 ComfyUI 的models下对应位置(扩散模型、文本编码器、vae 三个目录)。
第 3 步,导入工作流。仓库根目录的ref2.json是一份现成的 Ref2VA ComfyUI 工作流(含视频解码、音频解码和超分节点),导入后把图像/音频输入换成你的素材即可;如果你用 FL2VA,思路类似——只保留提示词和最多两张首尾帧图的输入。
✅ 生成前自查清单
- 报显存不足:先换 INT4 扩散模型,同时缩短时长、降低分辨率,这是最快的止血方式。
- 有画面没声音:检查两个 VAE 是否都下载并加载——工作流里音频 VAE 是独立的加载节点。
- 算子报错、模型无法加载:确认显卡架构。NVFP4 只在 Blackwell 上可用,其他架构请回到 INT4/INT8/MIXED。
- 文本编码器加载爆显存:多半是档位配错了,16GB 的卡不要挂 27GB 的 INT8 编码器。
- 音频当唯一输入失败:这是模型规格限制,音频必须搭配图像或视频一起输入。
📄 许可说明
MiniMax H3 及其量化衍生权重采用 MiniMax H3 社区许可协议。使用时请遵守合法使用条款:不生成违法、色情或侵犯第三方权利的内容,商业用途前确认符合协议约定。
建议路径:先按"INT4 扩散模型 + INT4 编码器 + 两个 VAE"的组合跑通一次完整流程,确认工作流没问题后,再按你的显存档位升级量化版本。本地部署视频生成模型,跑通比跑快更重要。
【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考