H3 热度未消,MiniMax 新模型已开始公测:百万上下文原生多模态,「太空兔」疑现
【免费下载链接】Minimax-H3-ComfyUI项目地址: https://ai.gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI
8 月 3 日,MiniMax 将通用全模态视频模型 H3 的权重全面开源,登顶开源社区热度榜、16 家芯片厂商 Day 0 适配、定价砍到主流模型三分之一——这波热度尚未消退;9 月 28 日,MiniMax 又悄然上线文本模型M3.1-Flash-Preview并开启公测,官方口径直指"原生多模态 + 百万上下文窗口"。更耐人寻味的是,就在公测前几天,一款名为 Space Bunny(太空兔)的匿名模型在中秋假期连续三天霸榜 OpenRouter 与 OpenCode 双平台调用量榜首,社区用分词器"验 DNA"的结果,把矛头指向了同一家公司。
从全模态视频生成到百万上下文文本公测,从匿名霸榜到产品揭面,MiniMax 正在用一套密集的产品节奏,把"视频赛道"的定义从生成能力之争,推向"多模态理解 × 长上下文 × 生态落地"的综合较量。本文结合全网社区情报与本仓库(Minimax-H3-ComfyUI)的真实源码,逐层拆解这三件事的技术含义与产品逻辑。
一、公测新模型的蛛丝马迹:百万上下文与原生多模态意味着什么
9 月 28 日,MiniMax 上线文本模型 M3.1-Flash-Preview 并开启公测。据官方信息,该模型支持原生多模态与百万上下文窗口,能够完成 Bug 修复、完整功能开发等任务,模型本身也可参与问题定位、代码实现与测试验证——这是一条典型的"编码 + Agent"定位描述,瞄准的是高频、规模化、可落地的工程场景。
拆开"百万上下文"与"原生多模态"两个词,技术含量并不低。MiniMax 官方 M3 系列页面披露的信息显示,其自研的 MSA(MiniMax Sparse Attention)稀疏注意力架构是百万上下文的基础设施:API 最高支持 1M token 上下文窗口,并保证最低 512K token 的有效长度。官方将其定义为"长程 Agent 任务、长程编码、长视频理解"的基础设施——注意"长视频理解"这四个字,这恰恰是文本模型与视频模型交叉的节点。
"原生多模态"则意味着更彻底的架构级设计:整个数据管线被重建以扩展预训练数据规模,多模态训练从预训练的第零步就开始,文本与视觉语义空间在训练早期即实现深度对齐,而非在文本模型之上"外挂"一个视觉编码器。这与 H3 官方技术博客中反复强调的设计哲学一脉相承:H3 的 Contextual Omni Representation 将语言视为"可泛化的桥梁",把视频、图像、音频、文本统一进开放的描述式任务形式;其理解管线对大多数素材需要约 100K token 的推理,再蒸馏到平均约 4K token。长上下文能力,正是全模态理解得以成立的前提——而 M3.1 把这条能力线推进到了百万级。
值得留意的是官方博客中的一句话:在下一代 H 系列中,MiniMax 计划整合 M 系列模型的能力。这意味着 M 系列积累的长上下文、Agent 化任务分解与多模态理解,未来将直接反哺视频生成模型——视频生成从"给一句话出一段片子",向"给一个项目级任务,自主拆解、分镜、生成、编辑、校验"演进。M3.1-Flash-Preview 的公测,可以被视为这条融合路径上提前亮出的一块拼图。
二、「太空兔」疑云:命名、定位与 H3 的产品矩阵关系
真正的戏剧性来自公测之前的插曲。9 月 23 日,一款名为Space Bunny(太空兔)的匿名大模型悄然上线模型聚合平台 OpenRouter 与编程平台 OpenCode——没有发布会、没有宣传物料、没有营销预算。而据 9 月 27 日统计,Space Bunny 在 OpenRouter 的 Token 调用量约为3.99 万亿,在 OpenCode 约为8.3 万亿,双双位居第一,且已连续霸榜三天。零推广状态下跑出数十万亿 Token 调用量,被社区戏称为"白嫖 3 天跑出 13.9 万亿 Token"。
身份谜团随后被社区用技术手段揭开:有开发者通过分词器指纹比对,判断该匿名模型大概率出自 MiniMax 之手;9 月 28 日 M3.1-Flash-Preview 正式公测后,开发者顺理成章地将两者关联起来——"太空兔"疑为 M3.1 系列在正式命名前的匿名灰度测试。匿名上线、免费调用、靠口碑自然冲榜,这种"先放匿名模型、再揭面"的冷启动打法,本身就是一次教科书级的社区传播实验:让能力自己说话,而不是让发布会替模型说话。
从定位看,Space Bunny / M3.1 所处的 Flash 赛道正处于白热化阶段:Google 六周内三次更新 Flash 系列,DeepSeek V4.1 Flash、智谱 GLM 5.3 Flash、小米 MiMo-V2.6-Flash 相继下场。OpenRouter 最新调用量榜单中,Space Bunny、DeepSeek V4.1 Flash 与 GLM 5.3 Flash 占据前三,组成 Flash 模型的新"御三家"。各家发力方向高度一致:增强编程、Agent 与多模态能力,同时把响应速度与使用成本放到更重要的位置,让模型承担高频、规模化的任务。
把这条线放回 MiniMax 的产品矩阵看,逻辑清晰:H3 负责"多模态生成"的心智占领——全模态输入、2K/15 秒/原生立体声、视频编辑能力全球登顶、开源权重拉拢开发者生态;M3.1-Flash 负责"高频调用"的流量与商业闭环——百万上下文、原生多模态、低成本快响应,直接承载编码 Agent 与规模化任务。一个打生态、一个打渗透,两者共享同一套"以语言为桥、全模态统一"的技术底座。H3 的开源解决了"能不能玩",M3.1 的公测解决了"玩得起、玩得快"。
三、接连放牌:MiniMax 的产品节奏对视频赛道意味着什么
把时间线拉直,MiniMax 的放牌节奏清晰可见:7 月 31 日 H3 发布(API 先行)→ 8 月 3 日开源权重 → 8 月至 9 月社区生态迅速发酵(ComfyUI 接入、量化权重、加速方案、LoRA 增强工具涌现)→ 9 月 28 日 M3.1-Flash-Preview 公测。两个月内,视频模型与文本模型双线并进,中间还穿插了一次匿名霸榜事件。
本仓库正是 H3 开源生态快速成熟的一个典型样本。作为 H3 的 ComfyUI 增强工具包,README.md 清晰展示了社区围绕 H3 基座权重的二次开发深度:7 个实验性 LoRA 覆盖五大能力方向——LMS 清晰度增强(loras/minimax_h3_lms_v1.0_r64.safetensors)、风格迁移(loras/minimax_h3_style_transfer_v1.0_r64.safetensors)、两个 VFX 编辑版本(含首帧传播 FFP 实验)、参考图换头(loras/minimax_h3_head_swap_v1.0_r32.safetensors)以及双版本 Live Wallpaper 动画,另附一个 2,000 步微调的 latent upscaler 实验权重(latent_upscaler/h3_upscaler_lms_v0.1.safetensors)。全部基于 Apache 2.0 协议、适配 Comfy-Org 官方 H3ref2va基座权重。
这套工具包背后是 H3 架构赋予的独特可控性。以 Live Wallpaper LoRA 为例(docs/live-wallpaper.md),它利用 H3 原生的 reference-to-video 条件机制,支持一张必选源图加最多两张中间帧/结尾帧的时间参考,通过live_wallpaper:触发词驱动:
live_wallpaper: Animate <Picture 1>, using <Picture 2> as the midpoint and <Picture 3> as the ending frame, with the camera gradually pulling back as the visible energy expands, swirls, and softly fades, while preserving the original subject and composition.VFX 编辑 LoRA(docs/vfx-edit.md)则展示了 H3 的"编辑即生成"范式——源视频通过MiniMaxH3AddGuide节点以frame_idx = 0注入对齐引导(aligned guide),引导层的隐空间帧与输出共享同一时空网格,从而锁定运动、节奏、构图与视听同步:
vfx_edit: Add fire effects to the man's hands while preserving his identity, pose, motion, clothing, framing, lighting and background.而换头 LoRA(docs/head-swap.md)更进一步,将参考人脸走 H3 原生图像参考通道、完整源视频走 Add Guide 通道,并用结构化的 subject_definitions / retention_analysis / detailed_description 提示词模板同时约束身份迁移与源表演保留——这种"以语言为桥"的任务表达,正是 H3 Contextual Omni Representation 设计哲学在工程层的直接体现。所有工作流都遵循 H3 支持的帧数约束(17n + 5),examples/ 目录下还沉淀了 LMS 对比、风格迁移、VFX 编辑、Live Wallpaper 等 30 余段示例视频供效果对照。
这种生态深度揭示了一个关键事实:H3 的开源不是"放出权重"就结束,而是把基座能力、可控接口、社区再创作三层同时开放。叠加官方公布的定价策略(2K 分辨率每秒价格低于主流模型三分之一、768p 低于主流 720p 的二分之一),以及首日 16 家芯片与生态伙伴的 Day 0 适配,"开源 + 低价 + 全栈兼容"构成了 MiniMax 对视频赛道的组合拳。
当然,节奏之下也有冷静面。社区实操反馈指出 H3 本地部署仍面临显存瓶颈、版本兼容与动作闪烁等工程问题;本仓库文档也反复标注这些 LoRA 是 research model 而非 finished tool,"结果会随源片段、分辨率、提示词与参考图大幅变化"。视频模型正从"能生成"走向"可控制、可落地、可量产",而 M3.1 带来的百万上下文与原生多模态,恰恰是视频内容生产从单镜头生成走向"长程理解 + Agent 化创作管线"的下一级台阶。
从 H3 开源、太空兔霸榜到 M3.1 公测,MiniMax 两个月内完成了一次从视频到文本、从生成到理解、从生态到商业的全面放牌。对视频赛道而言,竞争的下半场信号已经明确:谁能把"全模态理解 × 长上下文 × 开源生态 × 极致定价"捏合成一条完整的产品链路,谁就握住了从 Demo 到工业化生产的那把钥匙。
【免费下载链接】Minimax-H3-ComfyUI项目地址: https://ai.gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考