H3 多参考生视频教程:多张图一起上,人物场景全锁定
多参考生视频是什么?能做什么
前面几篇都是"一张图生成视频"。这一篇升级成多参考:一次给它 3~4 张图,每张图各管一件事——图 1 锁定女主长相、图 2 锁定男主造型、图 3 锁定场景环境,模型把所有素材融合起来生成一段视频。
这有什么用?图生视频最怕的就是"人物跑偏":只给一张图时,画面里多出来的配角经常长得随心所欲。多参考就是为这个设计的:
- 双人/多人剧情:女主一张图、男主一张图,两个人都不会跑偏
- 人物 + 场景分离:人物图管人物,场景图管环境,互不干扰
- 风格 + 人物组合:一张人物设定图 + 一张风格参考图,让同一角色出现在不同风格世界里
- 进阶玩法:除了图片,还能混合参考视频(学动作姿态)和音频(学人声音色)
整合包里对应的工作流是 H3-多参考生视频工作流(加速),只有一个版本,且自带官方三件套加速(int8 量化 + SageAttention + TE 蒸馏)。
第 1 步:打开多参考工作流
双击 ComfyUI启动器.exe(或运行 run_nvidia_gpu.bat),等浏览器弹出 ComfyUI 界面后:
- 在左侧「工作流」列表打开 AI星尘-Minimax H3 文件夹
- 选择 H3-多参考生视频工作流(加速).json

打开后,整体骨架和单图生视频加速版几乎一样(提示词、时长、分辨率、采样管线),唯一多出来的就是两三个「加载图片」节点——这就是多参考的核心。

第 2 步:认识要管的节点(比想象的简单)
1. 三个「加载图片」节点——每张图一个角色/一个场景
工作流里并排着 3 个「加载图片」节点(默认内置了 3 张古风图:公主、皇子、园林场景),双击每个节点分别上传你的素材:
- 第一个节点(ref_image_0):主角 A,比如女主
- 第二个节点(ref_image_1):主角 B,比如男主
- 第三个节点(ref_image_2):场景或风格参考
其实支持最多 4 张图(第 4 个参考位空着,需要时连线或用转换节点),3 张图对绝大多数场景已经够用。用不上的节点保持默认图即可,不影响生成。

2. 「Input Text (Prompt)」提示词——重点,多参考的灵魂
多参考工作流自带的范文是全系列最有价值的一段——电影级古风仙侠(皇子与公主在御园相会),它演示了怎么用 <图1>、<图2>、<图3> 给每张图分配任务。下一章逐段拆解。

3. 「Float (Duration)」时长——注意,默认是 10 秒
多参考工作流的时长默认 10 秒(前面几个工作流默认 5 秒),想快一点改成 5,最长 15。
4. 「Resolution Selector」分辨率
默认 16:9 横版、0.4 档。第一次跑显存紧张就降到 0.2。

剩下的采样管线、加速补丁、帧数自动计算全部自动,不用管。
第 3 步:多参考提示词怎么写(全文重点)
先看工作流里自带的官方范文(电影级古风仙侠,皇子与公主御园相会):
电影级古风仙侠 写实风格,UE5 渲染,光线追踪,柔和暖金色日光,
细腻丝绸面料质感,金属甲胄 PBR 材质,繁花海棠盛放,
静谧皇家宫廷园林环境。
使用 <图2> 锁定男性角色五官、铠甲、人物样貌;
使用 <图1> 锁定公主容貌、发饰与汉服细节;
<图3> 作为场景环境参考。
镜头一:中远景,御园湖面汉白玉石桥,花瓣缓缓在空中飘落。
蓝金战甲皇子缓步走向立于桥上的公主,一手轻按剑柄,神情温润沉静。
镜头缓慢向前推进,他轻声开口:"这场相见,我等候许久。"
说话间微风扬起蓝色长袍披风下摆,海棠花瓣环绕周身飞舞。
转场:淡入淡出柔和转场,花瓣掠过画面,轻微动态模糊。
镜头二:公主中近景特写,她微微侧首,温婉浅笑,发间流苏轻轻晃动,
轻声回应:"宫中春色,从未这般动人。"
镜头缓慢环绕二人,湖面日光粼粼波光。
镜头三:全景广角低机位镜头,皇子与公主并肩立于白石拱桥,
遥望远处古宫殿宇,衣袖在风中轻拂,镜头缓缓拉远定格。拆开看,它只有三段式结构:
- 第一段:整体风格——先定基调:电影级、写实、UE5 渲染、光线追踪、暖金日光、丝绸质感。这些词决定了画面的"高级感"。注意:风格写的是文字描述,不占参考图名额。
- 第二段:给每张图分配任务(多参考的核心)——
<图2>锁定男主、<图1>锁定女主、<图3>管场景。图片编号对应「加载图片」节点的顺序(第一个加载的图是 <图1>)。谁管什么说清楚,模型就不会混。 - 第三段:分镜时间轴——和单图篇一样的写法:镜头几、景别、谁做什么、镜头怎么动。这篇范文还带对白("这场相见,我等候许久"),H3 会真的配出台词声音——多参考适合做剧情片的另一个原因。
新手模板(多图版):
[整体风格一句话:写实/古风/赛博…,画质词]
使用 <图1> 锁定[人物A:长相/服饰];
使用 <图2> 锁定[人物B:长相/服饰];
<图3> 作为[场景]环境参考。
镜头一:[景别],[人物A做什么],[镜头运动],[对白可选]。
镜头二:[景别],[人物B做什么],[镜头运动],[对白可选]。
镜头三:[景别],[两人一起做什么],[收尾定格]。三个注意点:
- 图片编号不能搞错:<图1> 一定对应第一个「加载图片」节点。上传完图后,按节点从左到右的顺序在提示词里对应引用。
- 每张图管的事要分开说:女主图就写"锁定公主容貌发饰",别让它同时管场景。
- 图与图之间风格要统一:女主图是写实风、男主图是卡通风,生成出来会很违和。

第 4 步:跑通第一遍(完整操作流程)
- 先别换图,直接用内置的公主/皇子/园林三张图跑一遍,看官方范文的效果
- 跑通后再替换自己的素材:三个「加载图片」分别上传 人物A图 / 人物B图 / 场景图
- 按第 3 步模板改提示词(图片编号别搞错)
- 时长 10 秒、分辨率 16:9 先不动,点「执行」
第一次跑先加载模型(几分钟),然后逐帧生成。完成后点「保存视频」节点预览——会看到皇子与公主在御园相会,带对白、带古风配乐和环境音。


第 5 步:进阶玩法
多参考节点其实支持三类素材混合,视频和音频是"进阶接口":
- 视频参考(ref_videos):加一段参考视频,让生成结果学它的动作姿态/运镜(比如让视频里的舞姿用到你的角色身上)
- 视频音频参考(ref_video_audios):参考视频里自带的声音
- 独立音频参考(ref_audios):加一段人声/音乐,锁定人声音色或配乐风格
这些接口在当前工作流里默认没接线(连线是空的),要玩需要手动连线,属于进阶操作——先把 3 张图的玩法玩熟,再研究它们。

常见问题
- 两张人物图,生成出来像同一个人?人物图要选区别明显的:长相、服饰、发色反差越大越不容易混。提示词里把分工写死("<图1> 只锁定公主,<图2> 只锁定皇子")。
- 场景没按场景图来?确认场景图接在对应的「加载图片」节点,且提示词里写了"<图3> 作为场景环境参考";场景图尽量选大景别、无人物的。
- 只有一张图,用这个工作流行吗?行,把用不上的图节点保持默认即可,当单图用;但单图场景用单图工作流更顺手。
- 生成到一半报错 / 卡住?显存或内存压力:分辨率降到 0.2、时长 5 秒、关掉多余程序,重启 ComfyUI 再跑。
- 时长默认 10 秒好慢?改成 5 秒或降到 0.2 分辨率,会快很多。
- 对白可以不要吗?提示词里不写台词、声音设计里写"全程无对白"即可。
想直接开跑?
本教程用的是 AI星尘 Minimax-H3 整合包(官流、加速版、全部 16 个工作流和模型环境已内置,解压即用);已有 ComfyUI 环境的,可以单独购买 AI星尘 Minimax-H3 整合包 单独工作流(16 个工作流文件,导入即用)。