MiniMax H3 本地视频生成完整教程:16GB 显卡免费跑 2K 有声视频
【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
Minimax-H3-nvfp4-INT4-INT8-Convrot 是为本地部署打造的 MiniMax H3(海螺 3.0)量化权重合集:原模型被压缩成 INT4、INT8、混合精度、NVFP4 四种规格后,16–24GB 的消费级显卡也能做 MiniMax H3 本地视频生成,在 ComfyUI 里产出最高 2K 分辨率、最长 15 秒、自带立体声音轨的成片。不想花一分钱上云渲染的话,往下看——本文把装环境、挑模型、调参数三步一次讲清。
🧭 一分钟看懂:4 种量化 + 2 条产品线,该怎么选
这个仓库的本质:有人把 MiniMax H3 的全精度权重按INT4 / INT8 / 混合精度(MIXED)/ NVFP4四种规格重新压缩,并做了剪枝,让消费级显卡跑得动。模型本事一点没少——文本生视频、图像生视频、带立体声音频、最高 2K 分辨率、11 种语言对白,全都在。
权重分两条产品线,先按“你想怎么创作”选一条:
- FL2VA(首尾帧系列):输入 0 / 1 / 2 张图,适合纯文字生成和“起始帧、结束帧”控制,轻量、出片快
- Ref2VA(全参考系列):一次最多塞 9 张图 + 3 段视频 + 3 段音频(文件总数 ≤12),适合“角色 + 场景 + 声音”的复杂混合创作
命名规则很简单:文件名里带FL2VA或Ref2VA,再跟量化规格(int4/int8/mixed_int4_int8/nvfp4)。
⚡ 三步装好环境:克隆、放文件、对硬件
第一步:克隆权重仓库
git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot第二步:把权重放进 ComfyUI 对应目录
# 路径按你的 ComfyUI 实际安装位置调整 cp MiniMax_H3_Ref2VA_pruned_int8_convrot.safetensors ComfyUI/models/diffusion_models/ cp vae/minimax_h3_video_vae_fp16.safetensors vae/minimax_h3_audio_vae_fp32.safetensors ComfyUI/models/vae/第三步:按显存对号入座
| 你的配置 | 推荐选择 | 资源需求 | 适合场景 |
|---|---|---|---|
| 16GB 显存(RTX 4070 Ti Super / 4080 等) | mixed_int4_int8权重 + INT4 文本编码器 | 约 15.5GB 显存 | 日常创作、快速测试 |
| 24GB 显存(RTX 3090 / 4090) | int8剪枝权重 + INT8 文本编码器 | 约 21GB 显存 | 专业级高质量出片 |
| Blackwell 新卡(RTX 5090 等) | nvfp4权重 +nvfp4_awq文本编码器 | 12.5–24.4GB | 新架构尝鲜、极限省显存 |
⚠️ 无论哪张卡,
vae/里两个解码器必须一起拿:视频解码器minimax_h3_video_vae_fp16.safetensors(约 5.2GB)和音频解码器minimax_h3_audio_vae_fp32.safetensors(约 605MB)。漏掉音频那个,成片就没有声音。
📌 NVFP4 是 Blackwell 架构专用实验格式,30/40 系显卡完全跑不动,别浪费流量下载。
文本编码器(Qwen3-VL-32B,文件名qwen3vl_32b_minimax_h3_*.safetensors)放到ComfyUI/models/text_encoders/,量化规格跟显卡保持一致即可;更省显存的路线是 GGUF 版 CLIP,仓库示例工作流已经替你接好了。
🎬 出片四连:挑对模型、补全 VAE、抄参数、写提示词
第一步:挑对扩散模型
- 纯文字、或 1–2 张图 → 用
FL2VA系列 - 要多参考图 / 视频 / 音频混合 → 用
Ref2VA系列 - 拿不准就先下 FL2VA 混合版,占用最小、试错最快
第二步:补全 VAE 与文本编码器
确认models/vae/里视频、音频两个解码器都在,models/text_encoders/里放好与显卡配套的编码器。愿意直接导入仓库现成的 ref2.json 工作流的话,模型、VAE、加速节点都已接好,你只欠一句提示词。
第三步:照抄一组稳妥参数
| 参数项 | 推荐值 | 效果说明 |
|---|---|---|
| 分辨率 | 1344 × 768(16:9) | 仓库示例工作流默认档,画质与显存平衡;冲 2K 需另配 2K 增强流程 |
| 时长 | 5 秒(支持 4–15 秒) | 新手最稳的长度,越长越吃显存和时间 |
| 帧率 | 24 FPS | 模型原生帧率,不用动 |
| 画面比例 | 16:9 | 21:9 / 1:1 / 9:16 都支持,竖屏 9:16 投短视频平台 |
| 音频 | 32kHz 立体声(内置) | 视频自带原生声轨,不用额外配音 |
| 提示词语言 | 中 / 英等 11 种任选 | 用母语写即可,对白语言稳定支持 |
📌 默认短边为 768 像素;真要 2K 走 H3-Regenerate-2K 增强路线,直接拉高分辨率大概率爆显存。
第四步:写一句提示词,点运行
推荐用“总述 + Timeline 时间轴”格式,图生视频时末尾加[keyframe completion]标记绑定参考图:
Timeline: [0s-5s] 黄昏的湖面,白天鹅缓缓游过,镜头缓慢推进,电影感暖色调📂 目录结构一览:7 个权重 + 2 个 VAE 各放哪
仓库结构非常干净,每个文件都各司其职:
Minimax-H3-nvfp4-INT4-INT8-Convrot/ ├── MiniMax_H3_FL2VA_pruned_int8_convrot.safetensors # FL2VA INT8:最高质量,约 21GB ├── MiniMax_H3_FL2VA_pruned_mixed_int4_int8_convrot.safetensors # FL2VA 混合精度:16GB 卡首选,约 15.5GB ├── MiniMax_H3_FL2VA_pruned_nvfp4.safetensors # FL2VA NVFP4:Blackwell 专用,约 12.5GB ├── MiniMax_H3_Ref2VA_pruned_int8_convrot.safetensors # Ref2VA INT8:多参考高质量版 ├── MiniMax_H3_Ref2VA_pruned_mixed_int4_int8_convrot.safetensors # Ref2VA 混合精度:16GB 卡玩多参考 ├── MiniMax_H3_Ref2VA_pruned_nvfp4.safetensors # Ref2VA NVFP4:Blackwell 专用,约 12.5GB ├── MiniMax_H3_Ref2VA_nvfp4_mixed.safetensors # Ref2VA NVFP4 混合版,约 24.4GB ├── vae/ │ ├── minimax_h3_audio_vae_fp32.safetensors # 音频解码器(约 605MB),缺了就没声音 │ └── minimax_h3_video_vae_fp16.safetensors # 视频解码器(约 5.2GB),成片核心 ├── ref2.json # 现成 Ref2VA ComfyUI 工作流,导入即用 └── README.md # 官方说明:硬件选择、输入规格全在这完整的硬件对照和输入规格写在 README.md 里,选型拿不准时随时回查。
❓ 5 个高频翻车现场:显存不足、没声音、NVFP4 不兼容
运行时提示 Out of memory / CUDA OOM
- 换
mixed_int4_int8权重,这是最省显存的组合 - 分辨率降到 736×416 或 864×480,时长缩到 4 秒
- 关掉浏览器硬件加速等占显存的其他程序
视频出来了,为什么没有声音?
- 检查音频解码器
minimax_h3_audio_vae_fp32.safetensors是否在models/vae/里 - 确认工作流里视频 VAE、音频 VAE 两个都接上了,而不是只接了一个
- 音频输入必须搭配图像或视频,纯音频不能单独当唯一输入
RTX 3090 / 4090 下载了 NVFP4 版却跑不动
- NVFP4 只认 Blackwell 架构(RTX 50 系等)
- 换回
int8版(24GB 卡)或mixed版(16GB 卡) - 这是硬件限制,不是文件损坏,别反复重下
画面糊、和提示词对不上
- 24GB 显存直接上
int8高质量权重 - 提示词改写成
Timeline: [0s-5s] ...格式,把动作按时间写具体 - 图生视频加
[keyframe completion],加强参考图绑定
FL2VA 和 Ref2VA 到底下哪个?
- 纯文生视频或 1–2 张图 → FL2VA,小快灵活
- 多参考图 / 视频 / 音频混剪 → Ref2VA
- 各下各的也不冲突,两者分目录存放、互不干扰
🚀 进阶玩法:多参考混合、首尾帧锁、多语言对白
- 全参考混合创作:Ref2VA 一次最多收 9 图 + 3 视频片段 + 3 音频片段(总数 ≤12)——思路是“参考图定角色、视频片段定氛围、音频控节奏”,跨镜头角色也能保持一致。
- 首尾帧锁定:FL2VA 喂 2 张图——思路是“给模型开场和结尾,中间让它自己补”,适合规划运镜路线和故事转场。
- 多语言对白:中、英、日等 11 种语言稳定支持——思路是把台词直接用目标语言写进提示词,模型会同步生成对应语言的声轨。
⚖️ 许可与边界:商用前必看的 3 条
- 原模型及全部量化衍生权重以MiniMax H3 社区许可协议发布(并非通用开源许可),商用前请先核对使用限制
- 遵守合法使用要求:不侵犯第三方肖像权、知识产权,输入素材也要来源干净
- 规避不当内容;官方 API 侧有内容审核,本地部署的内容责任由你自己把关
🏁 行动清单:今天就跑出第一条
- 按显存选好权重,克隆仓库
- 文件放进 ComfyUI 对应目录,顺手导入示例工作流
- 先跑一条 5 秒、864×480 的测试片——看到第一个带声音的视频出来,你就完全上手了
💡创作提示:先用低分辨率跑通流程,再升到 1344×768;把成功的参数 + 提示词组合记下来,它就是你能反复复用的模板。
【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考