16GB 显卡跑 2K 带声音视频:MiniMax H3 量化模型本地部署完整指南
2026/8/25 9:05:28 网站建设 项目流程

16GB 显卡跑 2K 带声音视频:MiniMax H3 量化模型本地部署完整指南

【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

Minimax-H3-nvfp4-INT4-INT8-Convrot 把 MiniMax H3(海螺 3.0)视频生成模型的 INT4 / INT8 / NVFP4 量化权重整理进了同一个仓库,目标只有一个:让你用 16GB–24GB 显存的消费级显卡,在 ComfyUI 里本地生成 2K 分辨率、自带立体声音频、最长 15 秒的视频,而不用租大显存云卡。下面按"能输出什么 → 该下载什么 → 怎么跑起来"的顺序讲清楚。

🎬 先看懂它能输出什么

这条管线和你常见的文生视频工具最大的区别是音画同出:视频和立体声音频由同一个 Transformer 联合预测,对白还能跨 11 种语言(中、英、日、韩、法、德、西、俄、葡、意、阿拉伯语),你可以直接用母语写提示词。

输出项规格
时长4–15 秒
分辨率短边默认 768px;2K 生成需配合 H3-Regenerate-2K
帧率24 FPS
画幅21:9、16:9、4:3、1:1、3:4、9:16 等多种比例
音频32 kHz 立体声

输入侧分两个系列,文件名前缀不同,按需选择即可:

系列输入方式参考上限
FL2VA0/1/2 张图:纯文本生视频、首帧或尾帧图生视频、首尾帧控制
Ref2VA多模态参考输入:图像 + 视频片段 + 音频图 ≤9 张;视频 ≤3 段(每段 2–15 秒,总长 ≤15 秒);音频 ≤3 段(必须搭配图/视频,不能单独作为输入);文件总数 ≤12

只想要"文字变视频"就选 FL2VA;手里有多张参考图、片段或想混入音频,才需要 Ref2VA。

🧮 显存对号入座:五种量化文件怎么选

量化就是用少量画质换取数倍显存。这个仓库的好处是同一模型的各档量化都齐了,你只需要看自己的显卡是哪一档:

扩散模型(文件名中段区分系列)

文件后缀显存需求适合的显卡
_pruned_int4_convrot约 11.3 GB16GB(如 4070 Ti Super、4080),入门首选
_pruned_mixed_int4_int8_convrot约 15.5 GB16GB 且想留一点余量、画质比纯 INT4 好
_pruned_int8_convrot约 21 GB24GB(3090、4090),剪枝版里质量最高
_pruned_nvfp4(12.5 GB)/_nvfp4_mixed(24.4 GB)12.5–24.4 GB仅限 Blackwell 架构(RTX 5090、PRO 6000 等),30/40 系显卡不要下载

文本编码器(Qwen3-VL-32B,必须和显卡档位配套)

文件大小配套显卡
qwen3vl_32b_minimax_h3_int4_convrot.safetensors15.0 GB16GB
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1 GB24GB
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7 GBBlackwell

VAE 解码器(谁都必须下,共两个文件)

  • vae/minimax_h3_audio_vae_fp32.safetensors(605 MB)
  • vae/minimax_h3_video_vae_fp16.safetensors(5.21 GB)

漏掉音频 VAE 的常见后果就是:视频正常出来,但声音是空的。

🛠️ 三步把模型跑进 ComfyUI

第 1 步,克隆仓库。大权重文件走 git-lfs 拉取,机器上需要先装好 git-lfs,否则拿到的只是几百字节的指针文件:

git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

第 2 步,按上面的表挑 4 个文件:1 个扩散模型 + 1 个配套的文本编码器 + 2 个 VAE,分别放进 ComfyUI 的models下对应位置(扩散模型、文本编码器、vae 三个目录)。

第 3 步,导入工作流。仓库根目录的ref2.json是一份现成的 Ref2VA ComfyUI 工作流(含视频解码、音频解码和超分节点),导入后把图像/音频输入换成你的素材即可;如果你用 FL2VA,思路类似——只保留提示词和最多两张首尾帧图的输入。

✅ 生成前自查清单

  • 报显存不足:先换 INT4 扩散模型,同时缩短时长、降低分辨率,这是最快的止血方式。
  • 有画面没声音:检查两个 VAE 是否都下载并加载——工作流里音频 VAE 是独立的加载节点。
  • 算子报错、模型无法加载:确认显卡架构。NVFP4 只在 Blackwell 上可用,其他架构请回到 INT4/INT8/MIXED。
  • 文本编码器加载爆显存:多半是档位配错了,16GB 的卡不要挂 27GB 的 INT8 编码器。
  • 音频当唯一输入失败:这是模型规格限制,音频必须搭配图像或视频一起输入。

📄 许可说明

MiniMax H3 及其量化衍生权重采用 MiniMax H3 社区许可协议。使用时请遵守合法使用条款:不生成违法、色情或侵犯第三方权利的内容,商业用途前确认符合协议约定。

建议路径:先按"INT4 扩散模型 + INT4 编码器 + 两个 VAE"的组合跑通一次完整流程,确认工作流没问题后,再按你的显存档位升级量化版本。本地部署视频生成模型,跑通比跑快更重要。

【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询