H3 导演台首尾帧生视频教程:外部参考组(图组)多组并行,首尾两帧定镜头——向日葵含苞到盛开

2026-09-08 13:34 · 63 阅读
Minimax H3 实战 · 第 20 篇 / 共 20 篇 查看系列 →
H3 导演台首尾帧生视频教程:外部参考组(图组)多组并行,首尾两帧定镜头——向日葵含苞到盛开

前几篇教程里,导演台一次只处理一段:一张参考图、一段源视频。这一篇玩点大的——外部参考组(图组)把"一段"变成"一组",一个画布上同时挂 4 组素材,每组可以是不同的主体、不同的时长、不同的话,点一次运行,4 段视频排着队出。而图组走的任务模式是导演台里最特别的一种:首尾帧生视频,一张首帧图钉住开头、一张尾帧图钉住结尾,中间的过程交给模型自由发挥。

H3 首尾帧生视频是什么?能做什么

普通图生视频只钉死第一帧(首帧必须和参考图一致),后面模型随便跑,跑成什么样算什么样。首尾帧多钉了一头——最后一帧也必须和尾帧图一致。首尾都锁死,模型只负责"从 A 状态自然走到 B 状态"这一段中间过程。

能做什么:花苞到盛开、果实从青变红、白天转黑夜、人从门里走到门外、场景无缝变身——凡是开头一个状态、结尾一个状态的画面,都适合用首尾帧一次到位,不用像普通图生视频那样靠运气等模型自己收尾。

这个模式也有个机制层面的特点,先摆明:尾帧是硬锁定的关键帧,短片段在最后 1 帧会有一次"贴合"到照片的跳变感,属于模型特性不是 bug;想要完全无感,素材选"状态演化型"(花开花落这种)或者把时长放到 8 秒以上给模型留出提前到位的时间。正文后面有专门一节讲选材。

第 1 步:加载工作流

打开 ComfyUI,在「AI星尘-Minimax H3」文件夹里找到 「H3导演台-外部参考组(图组)工作流」 双击加载。界面是 3 层结构:最左边一排 4 个完全一样的节点叫 MiniMaxH3DirectorGroupImageToVideo(外部参考组·图组),每个组代表一段视频;中间的 MiniMaxH3DirectorGroupsCombine 把 4 个组合并成一条时间线;最右边的 H3 导演台 负责总调度。加载后先别动,跟着第 2 步认识一下这套结构。

image.png

第 2 步:认识组节点——一个组 = 一段视频

随便点开一个组节点,它只有 4 样东西,一眼能看懂:

  • first_frame(首帧图口):这组视频开头那一帧用什么图,钉死;
  • last_frame(尾帧图口):结尾那一帧用什么图,钉死;
  • 提示词框:这组视频自己的任务说明——只描述首帧到尾帧之间要发生的动作,开头结尾不用你管,模型自己会钉;
  • 时长:这组视频几秒钟(工作流里 4 个组分别是 3 秒、5 秒、5 秒、15 秒,各不相同,证明每组可以独立设时长)。

注意提示词和时长都是每组独立的——4 组素材可以各有各的说法、各有各的节奏,互不干扰。这就是"外部参考组"名字的由来:素材在组里各自就位,最后由合并节点统一喂给导演台排时间线。

还有一点:组节点的两个图口不是必须接满。三种形态都合法——只接首帧图:从这张图起片、结尾自由发挥(等于组内的"图生视频");只接尾帧图:开头自由、收尾钉死在这张图上;两张都不接:纯靠提示词讲故事(等于组内的"文生视频")。工作流里 4 组演示正好每种形态各占一个,第 4 步逐个说。

image.png

第 3 步:换素材——首尾帧图怎么生成、怎么接

工作流自带的演示素材可以先跑一遍看效果,正式用要把每组换成你自己的图。每组两张图,就两张,够简单。

首尾帧素材三原则:① 同一主体、同一机位、同一背景光线,只改变"状态"(花没开→开了、灯没亮→亮了、人没进门→进门了);② 演化型素材(花朵、天空、光影、物体变形)出片最稳,因为结尾落在"状态完成"上本来就很自然;③ 主体要占画面主体、背景越简单越好,给模型省力气。

本篇实测的素材是向日葵:首帧一张含苞待放的花苞,尾帧一张完全盛开的向日葵,两张图同机位同背景,只差一个开花状态。替换操作:把你的图用 LoadImage 加载,输出线分别接到组节点的 first_frame 和 last_frame 图口;工作流里现成的演示组,把原来的 LoadImage 换成你的图即可。

qwen_00001_.pngqwen_00002_.png

第 4 步:给每组写自己的提示词 + 时长

组提示词只干一件事:说清首帧到尾帧之间发生什么。首尾怎么衔接不用写——那是模型被硬锁的责任。实测向日葵组提示词(3 秒版):

一支向日葵花苞在微风中缓缓绽放,花瓣层层向外舒展张开,从含苞待放到完全盛开,金黄花瓣沐浴在晨光里,背景田野和天空静止不动,镜头固定。

时长框填 3(秒)。组提示词的写法跟着组的形态走,另外三组演示正好是三种示范:

  • 只挂首帧的组:从图起片、后面自由发挥,提示词要把"期望发生什么"说足,给模型指方向;
  • 只挂尾帧的组:收尾钉死,提示词负责讲"画面怎么一步步走到尾帧那个状态";
  • 不挂图的组(长文本):纯提示词当"文生视频"用,可以写很长的分镜文本。最后一组蜡笔猫演示就是这么写的——5 秒实拍与手绘发光动画融合的叙事,按 0-3 秒、3-6 秒、6-10 秒、10-13 秒、13-15 秒逐段给画面动作,末段收尾点题,最后一句锁定全程风格("全程保持手绘的粗粝感,拒绝过度的 3DCG 光泽")。长文本适合讲故事、短文本适合单一动作,短片段用长文本反而容易顾此失彼。

image.png

第 5 步:导演台设置确认,点运行

右侧导演台检查三处:① 任务类型 = fl2v — 首尾帧生视频(图组走的就是这条任务线,不用改);② 时间线已自动按 4 个组排好 4 段(合并节点的作用);③ 输出参数按需调,本篇实测是 3:4 竖版 0.2MP(384x544)、24 帧率、73 帧总长,帧率分辨率这些是全片统一的,每组不能单独设。确认后点运行。

运行后 4 段视频会按时间线顺序依次生成,一段跑完自动接下一段,全部出完看预览。本篇在 RTX 3080 Ti 16G 显存上,向日葵 3 秒那段(72 帧)约 4-5 分钟出片,4 组全跑完约 20 分钟上下,跑的时候该干嘛干嘛去。

image.png

向日葵实测:3 秒,含苞到盛开

先单独跑向日葵这组验证效果。出片结果:花苞在微风中轻轻颤动,花瓣一层层向外翻卷张开,颜色从苞叶的嫩绿过渡到花瓣的金黄,光斑跟着花瓣的展开在花盘上移动——3 秒正好是一朵花"醒过来"的完整过程。中间没有任何跳变、变形,背景全程静止,只有花在动。

注意成片最后一帧:会精确落在你给的尾帧照片上,这是首尾帧模式的机制——结尾那张"盛开"是尾帧图本体,模型把过程铺到位后贴上去的。花开的题材结尾落在盛开上,贴得毫无违和;这正是教程开头说的:演化型素材在这个模式里最顺。

MiniMaxH3_Director_external_i2v_00001__240_8fps.gif

多组并行实测:4 个组各跑各的,拼成一条时间线

把几种形态的组同时放进去跑一次,会立刻看清多组的真实工作方式——每个组是一次独立采样:组与组之间不是"接力配合",A 组的结尾不会成为 B 组的开头,而是各自生成各自完整的一段过程,最后按时间线顺序首尾拼接成一条长片。

用向日葵做的最直观验证:首帧组只挂花苞图、尾帧组只挂盛开图,两个组同时在线跑——结果是两段各自完整的 3 秒开花(首帧组自己从花苞开成花,尾帧组自己开成花再收在盛开图上),拼成一条 6 秒"花开两遍"的视频,而不是一段开一半、另一段接着开。

这也顺带回答了一个问题:尾帧锁定到底值不值?对开花这类演化型题材,光给首帧图+提示词,模型自己就能开出花——尾帧的价值不在"到不到得了",而在收得稳不稳:锁了尾帧,结尾精确落在你要的画面上,不会开过头、不收在奇怪状态。想要多段真正接力的连续镜头,那是另一种玩法(多段续接),图组的多组做的是"一个画布批量出多段"。

实测长文本组:把 15 秒的蜡笔猫叙事压缩成 5 秒版(0-2 秒橘猫探头、2-4 秒扑向屏幕、4-5 秒收尾点题)纯文字跑一次——时间轴分段指令跟得很准,3 段动作按描述的时间点依次发生,整体画面连贯可用。也暴露了纯文字组的边界:提示词写"鼻尖点出'喵'字涂鸦",模型实际做成电脑屏幕里浮现"喵"字收尾——文字该出现在哪个具体位置这种精细控制,没有图可锚定,模型容易理解偏差,生成后不满意就改提示词重跑,或干脆把"字出现在哪"这类要求交给有锁帧的组去表达。

MiniMaxH3_Director_external_i2v_00002__240_8fps.gifMiniMaxH3_Director_external_i2v_00003__240_8fps.gif

首尾帧模式的选材课:为什么有的顺、有的会"切"一下

用首尾帧跑过几个题材后,规律很清楚——顺不顺,取决于素材类型,不取决于提示词怎么写:

  • 演化型素材(推荐):花开花落、果熟、变色、变形、光影移动。这类素材的结尾=状态完成,模型铺的过程天然往尾帧收,末帧贴合无感。首帧尾帧要求同机位同背景,画面里只有"状态"在变;
  • 动作型素材(短片段会跳):狗抬头、人转身这类。动作走完后模型需要"提前到位并保持"才会平滑,3-5 秒的短片段动作刚铺完就到尾帧,最后 1 帧贴照片那一下肉眼可见,属正常现象。想要动作型也顺:时长放到 8-15 秒,提示词把动作前置(前 1/3 完成动作),后面留给模型冻结保持;
  • 绝对别做:首尾两帧差异过大(人物变成完全不同的人、场景整个换掉),中间会穿帮变形,模型硬填也填不出可信过程。

常见问题

问:首帧尾帧图必须自己画/自己拍吗?不用,任何能出图的路子都行——AI 出图(首尾两帧用同一段描述只改状态词,背景光线描述逐字复制)、视频抽帧、照片都行。原则就一条:两张图除了"状态"以外尽量一致。

问:换了素材图后,提示词里要不要描述首帧尾帧的画面?不用。组提示词只写中间发生的动作;首尾两帧长什么样,模型直接从图口看,写多了反而干扰。

问:4 组时长不一样,时间线怎么排?合并节点自动按组顺序首尾相接排时间线,每组几秒就占几秒,总时长=各组之和。想调整某段,改那个组的时长框即可。

问:能只跑其中一组吗?能。把不跑的组提示词清空或断开合并节点的对应输入,只留要跑的一组;本篇实测向日葵就是单独跑的。

问:输出是一整条长视频还是 4 个文件?按导演台的输出设置走,默认整条时间线导出;导出选项里有分段相关的设置,看你的用途选。

小结

外部参考组(图组)= 首尾帧模式 + 多组并行:每组两张图钉死首尾、一段提示词说清过程、一个时长框控制节奏,4 组合并进一条时间线一次出片。本篇用向日葵验证了演化型素材的出片效果——3 秒花苞到盛开,全程自然、末帧贴合无感。首尾帧是导演台里"控制力最强"的模式:开头结尾完全由你把控,代价是素材要按演化型去选、短动作片段要接受末帧贴合特性。到这儿,导演台的图、视频、参考视频、首尾帧四条任务路全通了,下一站:参考组玩法。

登录后分享可赚邀请积分
评论 (0)

登录后才能发表评论

去登录