Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作案例:6秒480×864视频生成实战
2026/8/8 20:44:05 网站建设 项目流程

Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作案例:6秒480×864视频生成实战

【免费下载链接】Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4项目地址: https://ai.gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4是一款针对MiniMax-H3视频生成的无审查文本编码器,采用NVFP4混合精度量化技术,文件大小仅15.7GB,可在单张16GB显卡上流畅运行,为普通创作者提供了高效的视频生成解决方案。

🚀 为什么选择这款文本编码器?

对于没有80GB高端显卡的创作者来说,Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4是理想选择。创意工作不应受限于数据中心级硬件,量化技术的意义就在于让更多人能够参与到视频创作中。

与其他版本相比,它具有明显优势:

版本大小是否适配16GB显卡
Heretic INT8-ConvRot(上游版本)26.4 GB否(需要内存卸载)
Heretic NVFP4(本项目)15.7 GB
Comfy-Org NVFP4(有审查)15.7 GB

它与Comfy-Org官方NVFP4编码器大小相同,是直接替代品:只需将CLIPLoader指向此文件,其余MiniMax-H3工作流程保持不变。

📊 实测性能数据

使用MiniMax-H3fl2va剪枝INT8扩散模型、res_multistep20步、ComfyUI 0.30.0、Sage Attention开启,生成6秒480×864垂直带音频视频的实测数据如下:

项目数值
GPU1× RTX PRO 2000 Blackwell(16 GB,sm_120)
生成期间峰值VRAM~9.9 GB
编码器加载到VRAM14.9 GB(动态加载)
ComfyUI进程使用系统内存~36 GB

在相同提示和种子下,将输出与上游INT8-ConvRot版本进行比较,两者视觉效果相当——量化不会改变编码器的描述内容。

📁 文件与安装

项目包含以下文件:

qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors 15.7 GB

安装步骤:

  1. 克隆仓库:git clone https://gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
  2. 将文件放置在ComfyUI/models/text_encoders/目录下
  3. CLIPLoader中选择(类型:minimax

你还需要从Comfy-Org/MiniMax-H3获取扩散模型和VAE。

⚙️ 技术原理与注意事项

旋转权重处理

上游权重经过旋转,其comfy_quant元数据为:

{"format": "int8_tensorwise", "convrot": true, "convrot_groupsize": 256, "per_row": true}

ConvRot将每个权重已乘以归一化的Hadamard矩阵(W_stored = W @ Hᵀ,每256宽组),并在运行时旋转激活以匹配。如果不解开旋转就将这些权重反量化并重新量化为普通NVFP4,会得到一个能加载、运行但生成完全无关视频的文件。

修复方法是在重新量化前再次乘以H

from comfy_kitchen.backends.eager.convrot_w4a4 import _build_hadamard def unrotate(w, gs=256): # w: 反量化 [out, in] out_f, in_f = w.shape h = _build_hadamard(gs, device=w.device, dtype=torch.float32).to(w.dtype) return torch.matmul(w.reshape(out_f, in_f // gs, gs), h).reshape(out_f, in_f)

混合精度处理

350个线性层为NVFP4(TensorCoreNVFP4Layout,组大小16)。model.embed_tokens(151936 × 5120 = 778 M参数)保留为INT8——与Comfy-Org在官方NVFP4版本中的选择相同。量化它对大小收益不大,且是在烘焙过程中会导致16GB显卡OOM的层。ComfyUI读取每层comfy_quant元数据,因此混合文件无需特殊处理即可加载。

烘焙过程在单张16GB GPU上约两分钟即可完成。

🔍 常见问题

  • 如果输出与提示无关而非仅仅质量较低,可能是旋转不匹配,而非量化问题。
  • 此版本继承上游INT8舍入,直接从BF16烘焙会略好,但我们没有这些权重。
  • NVFP4需要硬件支持,本项目使用Blackwell(sm_120)进行烘焙和推理。

📜 来源与许可

  • 无审查/Heretic工作:ethanfel
  • 原始编码器:Qwen3-VL-32B(阿里巴巴/Qwen团队),适用于MiniMax-H3
  • MiniMax-H3:MiniMaxAI
  • ComfyUI打包约定和量化布局:Comfy-Org
  • 此NVFP4重新量化:Lna-Lab(@Tono_Ken3)

许可遵循上游仓库;MiniMax-H3模型权重本身受MiniMax H3社区许可约束。

【免费下载链接】Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4项目地址: https://ai.gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询