Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作案例:6秒480×864视频生成实战
【免费下载链接】Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4项目地址: https://ai.gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4是一款针对MiniMax-H3视频生成的无审查文本编码器,采用NVFP4混合精度量化技术,文件大小仅15.7GB,可在单张16GB显卡上流畅运行,为普通创作者提供了高效的视频生成解决方案。
🚀 为什么选择这款文本编码器?
对于没有80GB高端显卡的创作者来说,Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4是理想选择。创意工作不应受限于数据中心级硬件,量化技术的意义就在于让更多人能够参与到视频创作中。
与其他版本相比,它具有明显优势:
| 版本 | 大小 | 是否适配16GB显卡 |
|---|---|---|
| Heretic INT8-ConvRot(上游版本) | 26.4 GB | 否(需要内存卸载) |
| Heretic NVFP4(本项目) | 15.7 GB | 是 |
| Comfy-Org NVFP4(有审查) | 15.7 GB | 是 |
它与Comfy-Org官方NVFP4编码器大小相同,是直接替代品:只需将CLIPLoader指向此文件,其余MiniMax-H3工作流程保持不变。
📊 实测性能数据
使用MiniMax-H3fl2va剪枝INT8扩散模型、res_multistep20步、ComfyUI 0.30.0、Sage Attention开启,生成6秒480×864垂直带音频视频的实测数据如下:
| 项目 | 数值 |
|---|---|
| GPU | 1× RTX PRO 2000 Blackwell(16 GB,sm_120) |
| 生成期间峰值VRAM | ~9.9 GB |
| 编码器加载到VRAM | 14.9 GB(动态加载) |
| ComfyUI进程使用系统内存 | ~36 GB |
在相同提示和种子下,将输出与上游INT8-ConvRot版本进行比较,两者视觉效果相当——量化不会改变编码器的描述内容。
📁 文件与安装
项目包含以下文件:
qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors 15.7 GB安装步骤:
- 克隆仓库:
git clone https://gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 - 将文件放置在
ComfyUI/models/text_encoders/目录下 - 在
CLIPLoader中选择(类型:minimax)
你还需要从Comfy-Org/MiniMax-H3获取扩散模型和VAE。
⚙️ 技术原理与注意事项
旋转权重处理
上游权重经过旋转,其comfy_quant元数据为:
{"format": "int8_tensorwise", "convrot": true, "convrot_groupsize": 256, "per_row": true}ConvRot将每个权重已乘以归一化的Hadamard矩阵(W_stored = W @ Hᵀ,每256宽组),并在运行时旋转激活以匹配。如果不解开旋转就将这些权重反量化并重新量化为普通NVFP4,会得到一个能加载、运行但生成完全无关视频的文件。
修复方法是在重新量化前再次乘以H:
from comfy_kitchen.backends.eager.convrot_w4a4 import _build_hadamard def unrotate(w, gs=256): # w: 反量化 [out, in] out_f, in_f = w.shape h = _build_hadamard(gs, device=w.device, dtype=torch.float32).to(w.dtype) return torch.matmul(w.reshape(out_f, in_f // gs, gs), h).reshape(out_f, in_f)混合精度处理
350个线性层为NVFP4(TensorCoreNVFP4Layout,组大小16)。model.embed_tokens(151936 × 5120 = 778 M参数)保留为INT8——与Comfy-Org在官方NVFP4版本中的选择相同。量化它对大小收益不大,且是在烘焙过程中会导致16GB显卡OOM的层。ComfyUI读取每层comfy_quant元数据,因此混合文件无需特殊处理即可加载。
烘焙过程在单张16GB GPU上约两分钟即可完成。
🔍 常见问题
- 如果输出与提示无关而非仅仅质量较低,可能是旋转不匹配,而非量化问题。
- 此版本继承上游INT8舍入,直接从BF16烘焙会略好,但我们没有这些权重。
- NVFP4需要硬件支持,本项目使用Blackwell(sm_120)进行烘焙和推理。
📜 来源与许可
- 无审查/Heretic工作:ethanfel
- 原始编码器:Qwen3-VL-32B(阿里巴巴/Qwen团队),适用于MiniMax-H3
- MiniMax-H3:MiniMaxAI
- ComfyUI打包约定和量化布局:Comfy-Org
- 此NVFP4重新量化:Lna-Lab(@Tono_Ken3)
许可遵循上游仓库;MiniMax-H3模型权重本身受MiniMax H3社区许可约束。
【免费下载链接】Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4项目地址: https://ai.gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考