☰
MiniMax H3全参考模式提示词改写指南:六段结构与保留分析实战
2026/9/25 2:47:02 网站建设 项目流程

1. 全参考模式到底在解决什么问题

第一次接触 MiniMax H3 的全参考模式(Ref2VA)时,我下意识把它当成了普通的图生视频来用,结果折腾了大半天,出来的片子跟参考图完全是两回事。后来才搞明白,Ref2VA 的核心逻辑不是“以某张图为第一帧”,而是把参考素材当成一种全局约束条件,让模型在生成过程中持续对齐参考里的主体特征、色调倾向和构图关系。

这个区别很关键。普通图生视频,你给一张图,模型只把它当作起点,后面怎么演化基本靠提示词自由发挥;而全参考模式是把参考图拆解成多个维度的信息——主体长什么样、穿什么颜色的衣服、背景是什么质感、光线从哪来——然后在每一帧里都尽量维持这些特征的一致性。说白了,它更像是一个“带着镣铐跳舞”的模式,自由度低了,但可控性上来了。

那为什么还要改写提示词?因为 Ref2VA 对提示词的敏感度和普通模式完全不同。普通模式下你写“一个女孩在雨中奔跑”,模型可能给你生成各种风格;但在全参考模式里,同样的提示词会跟参考图产生复杂的交互——参考图里女孩是短发,你提示词里写“长发飘飘”,模型就会陷入两难,最后出来的结果往往是两边都不像。所以提示词改写的本质,是让文字描述和参考素材之间形成互补而非冲突,把参考图无法表达的信息(比如动作、时间变化、镜头运动)用文字补上,同时避免文字去覆盖参考图已经固定的特征。

这套格式指南要解决的,就是“怎么写出跟参考图配合得好的提示词”这个问题。它适合已经上手过 H3 基础功能、想进一步提升参考一致性的朋友,也适合那些被“参考图明明很清晰但生成结果就是不像”困扰的创作者。接下来我会把参考标签体系、六段结构的写法、以及保留分析的具体操作拆开讲,都是我自己反复试出来的经验。

2. 参考标签体系:给每张图打上模型能读懂的标记

2.1 参考标签到底是什么

参考标签是我在 Ref2VA 工作流里最先要处理的东西。你可以把它理解成给每张参考图贴的“身份说明”,告诉模型这张图在本次生成中扮演什么角色、需要保留哪些特征、可以忽略哪些部分。没有标签,模型只能靠自己的视觉理解去猜,猜错了就是主体漂移、风格跑偏。

我一开始觉得标签是可有可无的,后来发现加了标签之后,同一组参考图生成的一致性明显提升。举个例子,我用一张人物半身像做参考,不加标签时模型经常把背景里的书架也当成必须保留的元素,导致镜头一动书架就变形;加上“主体参考,仅保留人物面部与服装,背景忽略”这样的标签后,镜头运动就自然多了。

标签的写法没有绝对标准,但有几个原则是我踩坑后总结出来的:第一,标签要短,控制在十个字以内,太长了模型反而抓不住重点;第二,标签要具体,说“保留红色外套”比说“保留服装特征”有效得多;第三,标签之间用分号隔开,避免逗号造成的歧义。

2.2 常用参考标签分类与适用场景

我把常用的参考标签分成几类,方便你按需取用:

标签类型示例写法适用场景注意事项
主体锁定主体参考;锁定面部人物、宠物、特定物体不要同时锁定多个主体,容易打架
风格迁移风格参考;色调对齐想要参考图的色彩氛围风格标签和主体标签不要混用
构图引导构图参考;机位对齐需要保持画面布局构图参考对镜头运动限制较大
局部保留保留服装;保留发型只关心某一部分特征要明确写出忽略其他部分
材质参考材质参考;纹理对齐产品展示、布料质感材质标签对光照变化敏感

这张表是我自己整理出来贴在显示器旁边的,每次写标签时对照一下,能省不少试错时间。需要强调的是,标签不是越多越好。我试过一张图贴五六个标签,结果模型直接“过载”,生成的东西四不像。一般来说,一张参考图配两到三个标签就够了,最多不超过四个。

2.3 标签与提示词的优先级关系

这里有个很多人会忽略的点:参考标签和提示词之间是有优先级顺序的。根据我的实测,当标签和提示词描述冲突时,模型倾向于优先满足标签里的约束。也就是说,如果你给参考图打了“锁定面部”的标签,但提示词里写“人物转头露出侧脸”,模型会尽量保持面部特征不变,但转头动作可能做得很别扭。

这个特性可以反过来利用。当你希望某个特征绝对稳定时,就把它写进标签;当你希望某个特征可以灵活变化时,就只在提示词里提,不要打标签。比如做产品展示视频,产品外观必须稳定,那就打“主体锁定”标签;而背景是纯色还是渐变,可以在提示词里描述,让模型自由发挥。

提示:标签和提示词冲突时,不要指望模型能完美平衡,最好的做法是从源头上避免冲突——要么改标签,要么改提示词。

3. 六段结构:把提示词写成模型能执行的“分镜脚本”

3.1 为什么是六段而不是一段

我最初写提示词就是一句话堆砌:“一个穿红裙子的女孩在咖啡馆里看书,阳光从窗户照进来,镜头慢慢推进。”这种写法在普通模式下勉强能用,但在 Ref2VA 里经常出问题——模型分不清哪些是必须保留的参考特征,哪些是希望生成的变化,结果就是该稳的地方不稳,该动的地方不动。

六段结构的思路,是把提示词拆成六个功能明确的模块,每个模块只负责一件事。这样模型在处理时能更清晰地分配注意力,该对齐参考的地方对齐参考,该自由发挥的地方自由发挥。这六个模块分别是:主体描述、动作与交互、环境与背景、光线与色调、镜头与运动、风格与画质。

这六个模块的顺序不是随便排的。主体描述放最前面,是因为模型对开头的信息最敏感;镜头与运动放在靠后位置,是因为它属于“全局指令”,太早出现会干扰模型对主体和环境的理解。这个顺序是我试了十几种排列组合后固定下来的,你可以直接照用。

3.2 六个模块的具体写法与参数建议

主体描述段要跟参考标签呼应。如果标签里写了“锁定面部”,这里就不要再详细描述五官了,只需要补充参考图里没有的信息,比如“人物表情从平静转为微笑”。如果标签里没有锁定,那这里就要写清楚主体的关键特征,但注意不要跟参考图矛盾。

动作与交互段是 Ref2VA 里最需要花心思的部分。因为参考图是静态的,动作全靠文字来驱动。我的经验是,动作描述要具体到身体部位和幅度,比如“右手缓慢抬起至胸前”比“做一个手势”有效得多。另外,动作幅度不要太大,全参考模式下大幅动作容易导致主体变形。

环境与背景段要明确哪些是参考图里已有的、哪些是新增的。如果参考图背景很干净,你想加一些元素,就在这里写;如果参考图背景复杂且你想保留,就写“背景保持参考图原样”。我一般会加一句“背景元素不遮挡主体”,避免生成时背景抢戏。

光线与色调段直接决定成片的氛围。Ref2VA 对光线描述很敏感,写“暖色调侧光”和“冷色调顶光”出来的效果差异巨大。如果你希望跟参考图色调一致,就写“色调对齐参考图”;如果想改变氛围,就具体描述光源方向和色温。

镜头与运动段控制的是“怎么拍”。这里可以用一些摄影术语,比如“缓慢推镜”“环绕运镜”“固定机位”。实测下来,Ref2VA 对“缓慢”这个词特别敏感,加了之后运动平滑度明显提升。另外,镜头运动幅度建议控制在中小范围,大幅运镜容易导致参考特征丢失。

风格与画质段是收尾,用来定调整体质感。可以写“电影感”“写实风格”“高清细节”等。这一段跟参考图的关系是:如果参考图本身风格很强,这里就写“风格对齐参考图”;如果参考图风格中性,你想加风格,就在这里指定。

3.3 六段结构的完整示例与拆解

拿一个实际案例来说。参考图是一张室内人像,暖光,人物穿米色毛衣,背景是书架。我想生成的视频是人物抬头看向镜头并微笑,镜头缓慢推进。

按六段结构写出来是这样的:

  • 主体描述:年轻女性,米色毛衣,发型与参考图一致
  • 动作与交互:缓慢抬头,视线从书本移向镜头,嘴角微微上扬
  • 环境与背景:室内书架背景,保持参考图布局,背景不遮挡人物
  • 光线与色调:暖色调,侧光从左侧窗户照入,色调对齐参考图
  • 镜头与运动:固定机位起始,缓慢推镜至中景
  • 风格与画质:写实风格,电影感,高清细节

这六段加起来不到一百字,但信息密度很高,而且每一段都有明确的功能。我拿这个结构跑了十几次生成,一致性明显比之前的一句话提示词好很多。你可以把这个例子当作模板,替换成自己的内容。

注意:六段结构不是死规矩,如果某个模块在你的场景里不重要,可以简化甚至省略,但主体描述和镜头运动这两段建议保留。

4. 保留分析:判断哪些特征必须稳住、哪些可以放手

4.1 保留分析的操作流程

保留分析是我在写提示词之前必做的一步。具体做法是:把参考图打开,拿一张纸或者开一个备忘录,列出图里所有的视觉元素,然后逐个判断“这个元素在生成中必须保持不变吗”。判断的标准有三个:第一,这个元素是不是主体的核心识别特征(比如人的脸、产品的logo);第二,这个元素变了会不会导致观众出戏;第三,模型有没有能力在变化中保持这个元素稳定。

我一般会把元素分成三档:必须保留、尽量保留、可以变化。必须保留的写进参考标签,尽量保留的写进提示词的主体描述段,可以变化的就不提,让模型自由发挥。这个分档过程看起来麻烦,但做熟了之后五分钟就能搞定,比反复生成再挑结果省时间得多。

4.2 不同场景下的保留优先级

不同场景下,保留的优先级完全不同。我做人物类视频时,面部特征和服装颜色是必须保留的,背景和光线可以适当变化;做产品类视频时,产品外观和材质是必须保留的,使用场景可以自由发挥;做风景类视频时,整体构图和色调是必须保留的,具体云层形状可以变化。

这里有个容易踩的坑:很多人会把“必须保留”的范围划得太大,结果提示词里全是约束,模型被绑得死死的,生成的东西僵硬不自然。我的经验是,必须保留的元素控制在三个以内,尽量保留的控制在五个以内,剩下的全部放手。宁可少约束,也不要过度约束。

4.3 保留分析跟提示词改写的衔接

保留分析做完之后,提示词改写的方向就清晰了。必须保留的元素,在参考标签里锁定,提示词里不再重复描述;尽量保留的元素,在提示词的主体描述段里用“保持”“延续”这类词来引导;可以变化的元素,就是提示词里重点发挥的地方,动作、镜头、氛围都往这里写。

举个例子,参考图是一个戴眼镜的男性在办公室。保留分析结果:眼镜和面部必须保留,衬衫颜色尽量保留,办公室背景可以变化。那么提示词里就不写眼镜和面部,主体描述段写“衬衫颜色延续参考图”,然后把笔墨集中在“人物从看电脑转为看向镜头”“镜头从侧面缓慢转到正面”“背景从办公室虚化为抽象光斑”这些变化上。这样写出来的提示词,既保住了核心特征,又有足够的变化空间。

5. 实操全流程:从参考图到成片的完整走一遍

5.1 素材准备与预处理

正式写提示词之前,素材准备这一步不能省。我一般会把参考图先过一遍,做三件事:裁剪到合适比例、检查分辨率、确认没有明显瑕疵。Ref2VA 对参考图的比例有要求,如果参考图是竖版但你想生成横版视频,最好提前裁剪或者留出扩展空间,不然模型会自动裁切,可能把关键部分切掉。

分辨率方面,我的经验是参考图短边不低于 768 像素,太低了解析不出细节,太高了处理速度会变慢。如果参考图有噪点或者压缩痕迹,建议先做一次轻度的降噪和锐化,但不要过度处理,否则模型可能把处理痕迹也学进去。

5.2 参考标签与提示词的协同编写

素材准备好之后,先写参考标签,再写提示词。写标签时对照第 2 节的分类表,确定每张图的角色。写提示词时按第 3 节的六段结构来,每一段都回头检查一下有没有跟标签冲突。这个检查步骤很重要,我至少有三分之一的失败案例是因为标签和提示词打架导致的。

协同编写的一个小技巧是:先把六段结构写完整,然后逐段跟标签对照,把冲突的地方改掉。比如标签写了“锁定面部”,提示词主体描述段里就不应该有“面部表情变化”之外的描述;标签写了“构图参考”,提示词镜头段里就不应该有大幅运镜。

5.3 生成参数设置与首轮测试

参数设置这块,我常用的配置是:生成时长 4 到 6 秒,帧率 24 或 30,运动幅度中等偏低。Ref2VA 模式下运动幅度不建议调太高,否则参考一致性会下降。首轮测试我一般会生成两到三个不同随机种子的结果,对比一下稳定性,如果三个结果差异很大,说明提示词或者标签有问题,需要回去调整。

首轮测试的另一个目的是检查参考特征有没有被正确保留。我会重点看三个地方:主体面部是否跟参考图一致、服装颜色有没有偏移、背景是否出现了不该有的元素。如果这三个地方都稳,再进入下一轮优化。

5.4 迭代优化与成片输出

迭代优化主要调三个东西:提示词里的动作描述、镜头运动幅度、光线色调描述。每次只调一个变量,这样能清楚知道是哪个改动起了作用。我一般会迭代三到五轮,每轮生成两到三个结果,挑最好的那个作为下一轮的基准。

成片输出前,建议做一次高清修复。Ref2VA 生成的结果在细节上可能有些模糊,尤其是面部和文字区域。高清修复的参数不要调太高,否则会出现过度锐化的塑料感。我的经验是修复强度控制在 0.3 到 0.5 之间,配合轻微的降噪,出来的效果比较自然。

6. 常见问题与排查技巧实录

6.1 主体漂移与特征丢失

这是 Ref2VA 最常见的问题。表现是生成视频里的人物跟参考图长得不像,或者服装颜色变了。排查思路是:先检查参考标签有没有正确锁定主体,再检查提示词里有没有跟标签冲突的描述,最后检查参考图本身是不是特征不够清晰。

我遇到过一次,参考图是侧脸,生成出来全是正脸。后来发现是提示词里写了“人物转向镜头”,模型为了满足这个动作,把侧脸特征丢掉了。解决办法是把动作改成“头部微微转动”,幅度小了,特征就保住了。

6.2 画面闪烁与帧间不一致

闪烁问题通常跟运动幅度和帧率有关。运动幅度太大时,模型在帧与帧之间来不及保持一致性,就会出现闪烁。我的解决办法是降低运动幅度,同时把帧率提高到 30,让过渡更平滑。另外,提示词里加“平滑运动”“稳定画面”这类描述也有帮助。

还有一种闪烁是光线引起的。如果提示词里写了“光线变化”,模型可能会在每帧里都改变光照,导致闪烁。这种情况就把光线描述改成“光线保持稳定”,或者干脆不写光线变化。

6.3 参考图风格被过度覆盖

有时候参考图本身风格很强,但生成结果却变成了另一种风格。这通常是因为提示词的风格与画质段写得太强势,把参考图的风格盖过去了。解决办法是在风格段写“风格对齐参考图”,或者干脆删掉风格段,让模型自己从参考图里提取风格。

我个人的习惯是,如果参考图风格明确,风格段就只写“对齐参考图”四个字;如果参考图风格中性,才在风格段里指定具体风格。这样能最大程度保留参考图的原始调性。

6.4 生成速度慢与资源占用高

Ref2VA 比普通模式吃资源,这是正常的。如果觉得速度太慢,可以尝试降低生成分辨率或者缩短时长。另外,参考图的数量也会影响速度,我一般控制在两到三张,太多了处理时间会明显增加。

还有一个容易被忽略的点:参考图的尺寸如果差异很大,模型需要额外时间来做对齐。建议把所有参考图统一到相近的尺寸和比例,能省不少时间。

问题类型典型表现排查顺序解决方向
主体漂移面部不像、服装变色标签→提示词→参考图锁定标签、减少冲突描述
画面闪烁帧间跳动、光线忽明忽暗运动幅度→帧率→光线描述降幅度、提帧率、稳定光线
风格覆盖参考风格丢失风格段→参考图质量对齐参考图、删风格段
速度慢生成时间长分辨率→时长→参考图数量降分辨率、缩时长、减图

这张表是我自己排查问题时用的速查表,基本上覆盖了八成以上的常见问题。遇到新问题的时候,我会先往这四类里套,套不进去再单独分析。

7. 我踩过的坑与独家经验

7.1 标签写太满反而坏事

刚开始用 Ref2VA 的时候,我总觉得标签写得越多越保险,一张图能贴七八个标签。结果模型直接“罢工”,生成的东西完全没法看。后来才明白,标签是给模型划重点,重点太多就等于没有重点。现在我的习惯是每张图最多三个标签,而且这三个标签必须是最核心的约束,其他的一律交给提示词去引导。

7.2 六段结构不是越长越好

六段结构容易让人产生“每段都要写很多”的误解。我一开始也是每段都写三四句话,结果提示词总长度超过三百字,模型处理起来很吃力,生成质量反而下降。后来我把每段压缩到一到两句话,只保留最关键的信息,总长度控制在八十到一百二十字之间,效果明显好转。提示词的质量在于精准,不在于篇幅。

7.3 保留分析要动态调整

保留分析不是做一次就完事的。我在迭代过程中发现,有些一开始觉得“必须保留”的元素,其实模型自己就能稳住,根本不需要额外约束;而有些一开始觉得“可以变化”的元素,反而在生成中变得不稳定。所以每迭代一轮,我都会重新过一遍保留分析,把不必要的约束去掉,把新发现的不稳定因素加进去。这个动态调整的过程,是提升成片质量的关键。

7.4 参考图的选择比提示词更重要

这句话可能有点反直觉,但确实是我的真实体会。一张好的参考图,特征清晰、光线均匀、背景干净,模型很容易就能抓住重点;一张差的参考图,模糊、杂乱、光线诡异,你提示词写得再好也救不回来。所以我现在花在选参考图上的时间,比花在写提示词上的时间还多。选图的标准就三条:主体突出、光线均匀、背景不抢戏。

7.5 多参考图的协同要分主次

用多张参考图时,一定要分主次。我的做法是选一张作为“主参考”,承担主体锁定和构图引导的功能;其他图作为“辅助参考”,只承担风格或材质参考的功能。如果两张图都打主体锁定标签,模型就会不知道该听谁的,结果就是两个主体的特征混在一起,出来一个四不像。主参考只能有一张,这个原则我从来没破过例。

8. 进阶玩法:把 Ref2VA 用出导演台的感觉

8.1 用参考标签模拟分镜控制

熟悉了基础流程之后,我开始尝试用参考标签来模拟分镜控制。具体做法是给不同参考图打上不同的“镜头角色”标签,比如“主参考-中景”“辅助参考-特写”“辅助参考-远景”,然后在提示词的镜头段里写“从远景过渡到中景再切特写”。这样模型在生成时,会参考不同图片的构图信息来构建镜头变化,出来的效果有点像简易版的分镜脚本。

这个玩法对参考图的要求比较高,需要准备同一主体在不同景别下的图片。但一旦跑通,能实现的镜头语言就丰富多了。我拿这个思路做过一个产品展示视频,从全景到特写再到全景,过渡很自然,客户看了还以为我是用专业分镜软件做的。

8.2 结合导演台工作流的思路

如果你用过 H3 的导演台功能,会发现 Ref2VA 的六段结构跟导演台的分镜逻辑其实是可以打通的。导演台是把视频拆成多个镜头分别生成再拼接,而 Ref2VA 的六段结构是在单个生成任务里模拟多个镜头的切换。两者结合的做法是:用导演台规划整体分镜,每个分镜用 Ref2VA 加六段结构来生成,最后在导演台里拼接。

这样做的好处是每个分镜的参考一致性都能单独控制,不会因为一个分镜出问题影响整条片子。缺点是工作量比单次生成大,适合对质量要求高的项目。我一般只在商业项目里用这个流程,个人练习还是单次生成居多。

8.3 高清修复与后期衔接

Ref2VA 生成的结果直接输出的话,细节上可能差口气。我的后期流程是:先做一次轻度的高清修复,再做一次色彩微调,最后加一点颗粒感来统一质感。高清修复的参数前面说过了,色彩微调主要是把参考图的色调再拉回来一点,因为生成过程中色调可能会有偏移。颗粒感不要加太多,一点点就够了,目的是让画面看起来更自然,不是做旧。

后期这一步看起来跟提示词改写没关系,但实际上,如果你在提示词阶段就把光线和色调描述得很准确,后期需要调整的幅度就很小,画质损失也更少。所以提示词写得好,后期省一半事,这话不夸张。

8.4 批量生成的参数管理

做系列视频的时候,我会把六段结构做成模板,只替换主体描述和动作描述,其他四段保持不变。这样能保证系列视频的风格一致性,同时减少重复劳动。参数方面,我会固定随机种子范围、运动幅度和帧率,只调整提示词内容。批量生成时建议先跑三到五个测试,确认模板没问题再全量跑,不然批量出废片很浪费时间。

模板管理有个小技巧:把六段结构存成文本片段,用的时候直接调用,避免每次重新写。我自己的模板库里存了十几套不同场景的六段结构,人物类、产品类、风景类都有,用的时候改几个词就能跑,效率提升很明显。

9. 一些关于工具链和环境的零散经验

9.1 本地部署与在线使用的取舍

Ref2VA 在本地部署和在线使用之间,体验差异主要在处理速度和批量能力上。本地部署的优势是批量生成方便,不用排队,适合需要大量迭代的场景;在线使用的优势是省去了环境配置的麻烦,适合快速验证想法。我自己的做法是:前期用在线快速试提示词,确定方向后再转到本地批量生成。

本地部署对硬件有一定要求,显存建议不低于 12GB,否则处理高分辨率参考图时会比较吃力。如果显存不够,可以降低参考图分辨率或者减少同时加载的参考图数量。在线使用的话,注意一下单次生成的时长限制,太长的视频可能需要分段生成再拼接。

9.2 整合包与工作流的选择

市面上有一些整合好的工作流包,把 Ref2VA 的各个步骤串起来了。我的建议是,如果你刚接触 Ref2VA,先用原生流程走一遍,搞清楚每个环节在做什么,再去用整合包。不然出了问题你都不知道该从哪里排查。整合包适合已经熟悉流程、想提升效率的人。

选择整合包的时候,重点看它有没有把参考标签和六段结构的输入界面做好。如果整合包只是把参数堆在一起,没有做结构化的输入引导,那用起来跟原生流程差别不大。好的整合包应该能引导你按六段结构来写提示词,并且自动检查标签冲突。

9.3 版本更新与兼容性注意

H3 的版本更新比较频繁,每次更新后 Ref2VA 的行为可能会有细微变化。我的习惯是更新后先跑一组基准测试,用固定的参考图和提示词生成一遍,对比更新前后的结果。如果发现一致性下降或者出现新的问题,就回退到上一个版本,等下一个版本再试。

另外,不同版本对参考标签的解析方式可能不同。我遇到过某个版本突然不认“锁定面部”这个标签了,换成“面部参考”才正常。所以更新后如果发现标签失效,先试试换个写法,不一定是模型坏了。

10. 最后分享几个提升成功率的小习惯

第一个习惯是每次生成前花两分钟做保留分析,把必须保留、尽量保留、可以变化的三档元素列出来。这两分钟能省下后面二十分钟的反复生成。

第二个习惯是提示词写完后朗读一遍,看看有没有前后矛盾的地方。朗读能发现默读时忽略的逻辑冲突,尤其是标签和提示词之间的冲突。

第三个习惯是每轮迭代只改一个变量。同时改多个变量的话,你永远不知道是哪个改动起了作用,也没法积累经验。

第四个习惯是建一个自己的案例库,把成功的参考图、标签、提示词、参数都存下来。下次遇到类似场景,直接调用改一改就行,不用从零开始。

第五个习惯是不要追求一次完美。Ref2VA 的生成有随机性,同样的输入不同种子结果可能差很多。我的做法是每轮生成三个结果,挑最好的那个作为基准继续迭代,而不是死磕一个结果反复重跑。

这些习惯看起来都是小事,但积累下来,我的成片率从最开始的三成提升到了现在的七成以上。Ref2VA 这个模式,说到底是一个需要耐心调教的工具,你花时间理解它的脾气,它就会给你稳定的回报。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询