H3 多模态参考导演台教程:宫格分镜、多模态参考,一个节点全搞定
多模态参考导演台是什么?能做什么
前几篇的工作流,都是"一个节点干一件事":放参考图、写提示词、设参数,各管各的。这一篇完全不同——整合包里的多模态参考导演台,把参考素材、时长、比例、提示词、音视频潜空间全部集中到一个巨大的导演台节点里,像导演一样在一个地方统管全局。
它最特别的三个能力:
- 双模式:顶部一个按钮在「宫格模式」和「全能参考」之间切换——宫格模式适合"多图拼格做分镜",全能参考适合"图片+视频+音频混着喂",两种模式的素材互不串用,切走再切回来内容还在
- 多模态参考:最多 9 张图片 + 3 段视频 + 3 段音频 一起当参考——图片锁人物场景、视频学动作运镜、音频学声音,全都能喂
- 统一输出:导演台直接把"模型、提示词条件、音视频潜空间"全部做好,后面接的采样管线和前几篇一模一样
第 1 步:打开导演台工作流
启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:
- 在左侧「工作流」列表打开 AI星尘-Minimax H3 文件夹
- 选择 H3多模态参考导演台工作流.json



打开后最显眼的就是中间那个超大个的深绿色节点——导演台。它自带一份使用说明(画布左上角黑色便签),新手建议先看一遍。
第 2 步:认识导演台节点
导演台节点从上到下分三个区域:
- 顶部:模式切换——「宫格模式 / 全能参考」按钮,两种模式的素材互相独立
- 中部:素材区——「+图片 / +视频 / +音频」按钮,点一下就能添加参考素材
- 下部:全局参数——目标时长(默认 15 秒)、输出比例(16:9 横屏等)、参考图精度、输出像素规模、全局创作要求(对整个视频都生效的总提示词)

模式切到「宫格模式」时,节点中部还会多出宫格格式(2x2 四宫格 / 3x2 六宫格 / 3x3 九宫格)和白边裁剪强度两个参数——它们是宫格模式专用的。
第 3 步:宫格模式——多图拼格做分镜
宫格模式适合"先把剧情画成格子,再让 AI 拍成视频"的分镜玩法:
- 顶部切换到宫格模式
- 选宫格格式:3x2 六宫格(示例默认),也可以 2x2 四宫格或 3x3 九宫格
- 把分镜图一张一张放进宫格——每个格子就是未来视频的一个镜头画面
- 在宫格分镜文本里写这段视频的剧情描述(每个格子讲了什么、镜头怎么衔接)

白边裁剪强度(默认 1)控制拼格时白边的处理:值越高越 aggressively 裁掉宫格之间的白边,分镜图留白多时可以调大它。
第 4 步:全能参考模式——图、视频、音频一起喂
实例:六宫格分镜「鸣人与雏田的日常」——下面用一套完整的六宫格案例演示三个字段怎么填(分镜图一格一个镜头,火影题材日常温馨向):
全局创作要求(整段视频的画风与人物锁定):
「动画电影级写实渲染风格,木叶村日式房屋内景,暖色柔光,温馨治愈日常氛围。人物形象严格匹配参考图:鸣人金色短发、蓝色眼眸、脸颊三对胡须纹、橙色运动服;雏田黑色长直发、白眼、浅紫色上衣。光线柔和自然,色彩温暖明亮,电影感构图,人物动作流畅自然,表情细腻生动,画面稳定不闪烁,背景细节丰富。」
画面、动作、镜头与台词(每个格子拍什么):
「镜头1(图1):鸣人盘腿坐在窗边榻榻米上看书,神情专注;雏田站在门口,微微侧头偷看他,脸颊泛红,欲言又止。雏田(轻声自语):"鸣人君……还是这么认真呢。"」
「镜头2(图2):雏田双手捧着一束刚摘的花,低头看着花朵,脸泛红晕。雏田(内心独白):"这朵花……要送给他吗。"」
「镜头3(图3):正面镜头,两人并肩坐在窗边,鸣人笑着挠头,雏田低头绞着手指。鸣人:"雏田,你刚才是不是叫我啦?"雏田(小声):"没、没什么……"」
「镜头4(图4):正面镜头,雏田鼓起勇气把花递到鸣人面前。雏田:"鸣人君,这个……送给你!"」
「镜头5(图5):鸣人接过花开心大笑,雏田露出温柔笑容。鸣人:"哈哈,谢啦雏田!这花真好看!"」
「镜头6(图6):背面镜头,两人背对镜头并肩坐在屋檐下,夕阳洒进屋内,安静温馨,画面定格。」
声音与台词补充(配音与环境音设计):
「雏田轻声细语、羞涩温柔;鸣人声音爽朗阳光。环境音:微风蝉鸣、纸页翻动、木门轻响。音效:雏田心跳声在镜头2、4处微微放大。背景音乐:温暖舒缓的钢琴+弦乐,镜头3 渐入、镜头6 最柔和后渐出。」
填写要点:全局创作要求负责"画风和人物不跑偏"(角色特征写死在全局里,配合参考图双保险);画面动作镜头台词负责"每个格子拍什么"(一格一段,写清景别+动作+台词+运镜);声音台词补充负责"听起来怎么样"(配音语气、环境音、BGM)。三个字段分工明确,填好直接出片。

全能参考模式是这篇的重头戏,把多模态参考玩到极致:
- 顶部切换到全能参考
- 点+图片:添加人物/场景参考图(和前面几篇的多参考一样,锁定人物和场景)
- 点+视频:添加参考视频——AI 会学习它的动作、运镜(比如你想复刻某段舞蹈的动作,就把舞蹈视频拖进来)
- 点+音频:添加参考音频——AI 会学习声音特征(音色、氛围、人声)
- 在全局创作要求里写整段视频的总提示词

参考素材不是随便加的,H3 有硬性限制(导演台使用说明里写得明明白白):
- 最多 9 张图片、3 段视频、3 段音频
- 单段视频或音频必须 2~15 秒,参考视频总时长、参考音频总时长都不超过 15 秒
- 音频不能作为唯一参考——必须同时有图片或视频,光喂音频会报错
- H3 固定 24 帧/秒
⚠️ 超时警告:参考素材一旦超过 15 秒,运行会直接报错(提示「超过 H3 的 15 秒上限」)。注意视频自带的声音轨也算音频参考——视频超 15 秒会同时触发视频和音频双重超限。解决办法:先把素材裁剪到 15 秒以内再导入(用剪辑软件,或 ComfyUI 里的视频裁剪/截取节点)。
实例:全能参考「耄耋猫跳舞」——图、视频、音频三样全用的完整案例:图片锁角色、视频锁动作、音乐锁节奏。素材准备:一张拟人老猫参考图 + 一段 15 秒以内的跳舞视频 + 一段 15 秒以内的音乐。⚠️ 音频参考同样受 15 秒限制:视频自带的音轨也算音频,和单独添加的音乐合计不能超 15 秒(实测视频 12 秒 + 音乐 25 秒会直接报错),音乐太长先裁剪。
全局创作要求:动画电影级写实渲染风格,活泼欢快的舞台氛围。角色严格匹配参考图:一只拟人化的耄耋老猫(毛发灰白、胡须花白、神态慵懒又俏皮),全身形象完全遵循参考图,不得改变造型。动作学习参考视频的舞步与节奏,身体协调流畅;画面色彩明快温暖,电影感布光,动作流畅自然,表情生动,画面稳定不闪烁,背景细节丰富。
画面、动作、镜头与台词:镜头1 中景,老猫站舞台中央随音乐节奏点头打拍子(老猫低沉慵懒:"年纪大了,腰腿不如从前——但舞,还是要跳的。");镜头2 近景,老猫转圈,胡须轻颤("这招,叫老汉推磨。");镜头3 中景,随节拍左右摇摆,尾巴打拍子;镜头4 全景,谢幕鞠躬。舞蹈动作严格跟随参考视频的舞步与节奏,幅度可稍放缓,体现老猫的从容。
声音与台词补充:老猫声音低沉慵懒带俏皮,念白节奏跟音乐节拍;环境音布料摩擦、爪子踏地;音乐重拍加铃铛/擦片点缀;背景音乐风格与节奏完全跟随参考音频,欢快活泼,谢幕时渐弱。
效果:输出 = 老猫形象 × 参考视频舞步 × 参考音乐节奏——图、视频、音频各管一件事,这就是全能参考的核心用法。
第 5 步:设置参数,点运行
运行前过一眼导演台参数区:
- 目标时长:默认 15 秒(H3 参考限制内越长越慢),拖任务时长按需改
- 输出比例:16:9 横屏(默认),也可切 9:16 竖屏、1:1 方形——做抖音竖屏视频就切 9:16
- 输出像素规模:默认 0.5 MP——分辨率按比例对照表自动计算(16:9 下 0.5MP≈864×480;0.3MP≈736×416;1.0MP≈1376×768),显存紧张就调小,要清晰就调大
- 参考图精度:默认"匹配输出(推荐)",不用动
时长、帧率与分辨率的关系(新手必读):生成帧数 = 目标时长 × 24 帧/秒(H3 固定 24fps);输出分辨率 = 输出像素规模 × 输出比例计算(32 对齐,16:9 下 0.2MP≈608×352、0.5MP≈864×480)。帧数和分辨率直接决定出片速度:默认 15 秒 + 0.5MP = 360 帧 @864×480,实测要 1 小时以上。提速建议:目标时长 5~8 秒(120~192 帧)+ 像素规模 0.2~0.3MP,速度可快 5 倍以上,画质仍够用(耄耋猫案例即用 5 秒 + 0.2MP 测试,几分钟出片)。

然后点右侧「运行」。导演台会把所有素材和参数编译成条件,走采样 → 视频 VAE 与音频 VAE 分别解码 → 「创建视频」合成为带声音的成片,保存到 output 目录。

模型与加速(不用动,但要知道)
- 主模型:Ref2VA 专用模型(minimax_h3_ref2va_pruned_int8,19.5GB)——和上一篇多参考多轨编辑同款,专门吃参考素材
- 文本编码器:Qwen3VL-32B——注意下拉里默认选的是 int8 版(约 25GB),16G 显存跑不动或报内存不足时,把它换成 nvfp4 版(qwen3vl_32b_minimax_h3_nvfp4_awq,约 14.6GB),模型效果基本一样,内存压力小一半
- 双 VAE:视频 VAE + 音频 VAE——画面和声音分开解码,成片才带声音
- 采样器:20 步 / simple / res_multistep(H3 标准配置)
- 双加速已内置:SageAttention + TE 蒸馏(绿色加速组),不用额外操作
常见问题
- 报错「超过 15 秒上限」?参考视频/音频超了 15 秒(视频自带的音轨也算音频),裁剪到 15 秒以内再导入
- 报错说音频不能当唯一参考?很正常,H3 要求音频必须和图片/视频一起用,加一张参考图即可
- 参考视频加载失败/报错?检查时长:单段 2~15 秒、总长不超 15 秒,超了先裁剪
- 加载就爆内存?CLIP 换成 nvfp4 版(14.6GB);输出像素规模调到 0.3~0.5
- 宫格模式和全能参考的素材串了?不会——两种模式的素材互相独立,切回对应模式内容还在
- 改了导演台或换了节点版本?安装/更新导演台插件后必须完全重启 ComfyUI 才生效
小结
多模态参考导演台把"素材、分镜、参数、提示词"收进了一个节点:宫格模式做多图分镜,全能参考混喂图/视频/音频,时长比例一个地方统管。前面几篇学会的参考图用法、提示词写法在这里全部通用,只是操作入口变成了一个"导演台"。