H3 导演台参考视频生视频教程:原视频动作照搬,主角换成参考图的人——黑衣男变古风女子
H3 参考视频生视频是什么?能做什么
这一篇教 H3 导演台 · 参考视频生视频工作流(整合包内文件:H3导演台-参考视频生视频.json)。它是这一系列里最能"整活儿"的一篇,先理清三兄弟的关系:
- 参考图生视频:一张图,让图里的人"活"成一段原创视频(动作是模型编的)
- 视频生视频:一段视频 + 文字指令,给现成视频"化妆"(改毛色、换背景),动作原样保留
- 参考视频生视频(本篇):一段视频 + 一张参考图,把视频里的人物整个换掉——动作、节奏、镜头还是原视频的,人换成了参考图里的人
说人话:参考视频提供"戏"(谁在做什么动作),参考图提供"角"(换上去的人长什么样),两路一合成,一支"换人不换戏"的新视频就出来了。你想让网上下载的舞蹈、教程动作换成自己的形象,或让视频素材里的人换成你想要的形象,都是它的活。
本文演示案例:一段 2.3 秒的短视频里有个穿黑衣的人在活动,用一张古风女子的参考图,把视频里的黑衣男整个换成古风女子——人物换了,动作、节奏、镜头全程保留。


第 1 步:准备素材 + 打开工作流
准备两份素材:
- 参考视频:你希望保留动作的那段视频,复制到 ComfyUI 的 input 文件夹(本文用一段 2.3 秒、30 帧率的短视频)
- 参考图:换上去的人物照片——正面、清晰、光线均匀的全身或大半身照效果最好,同样放进 input 文件夹方便选择
文件名都改简单点,比如 source-video.mp4、girl.jpg,加载时好认。
然后打开 AI星尘-Minimax H3 文件夹里的 H3导演台-参考视频生视频.json。画布结构跟前两篇一致,分三组:
- 模型加载组(左上):底模还是那个 ref2va int8 量化版(参考视频/图生视频都走它)+ Qwen3-VL 文本编码器 + 双 VAE
- 导演台大节点(中间):视频加载、参考图加载、任务提示词、输出设置全在一个面板里
- 输出组(右侧):CreateVideo 合成 + SaveVideo 保存到 video 文件夹
文件里默认带官方演示数据,打开后先别管,第 3 步加载自己的素材时会整体替换掉。

第 2 步:确认模式
导演台顶部会显示当前模式,本工作流应该是「视频编辑(rv2v)/ 参考视频生视频」一类的模式名(各版本显示文字略有差异),以打开面板的显示为准——只要加载的是参考视频生视频这个文件,模式就是对的,不用手动切换。

第 3 步:把参考视频加载进时间线
点导演台里的加载视频按钮,选 input 文件夹里的 source-video.mp4。加载后:
- 官方演示数据被清掉,时间线上出现你的视频片段
- 片段下方能看到源视频的分辨率、帧率——记下这两个数,第 6 步输出设置要用(本文素材 69 帧、30 帧率、约 2.3 秒)

第 4 步:加载参考图,锁定"换上去的人"
在导演台找到参考图槽位,把古风女子照片加载进去(点槽位选择 input 里的 girl.jpg)。加载后导演台会自动识别这是一份"角色参考"——参考图决定新人物长什么样:发型、五官、服饰风格都跟着它走。
小提示:参考图里的人物最好姿势自然、五官完整无遮挡,照片质量直接决定换上去的脸和形象质量。

第 5 步:写任务提示词,说清"换掉谁"
素材都就位后,在导演台的任务/编辑提示词框里告诉模型要做什么。句式跟视频生视频同一套——说清"把谁换成谁",再钉一句"其他不变":
把视频里穿黑色衣服的男人换成参考图1里的古风女子,动作和场景保持不变
导演台会基于你的描述生成任务行(如「将视频中的黑衣男替换为参考图1中的古风女子」)。写提示词三个要点:
- 指出参考图要写"参考图1":模型靠这个编号认人,别只写"那个女的"
- 主体描述给足线索:黑衣男——衣服颜色 + 性别 + 位置关系都点上,防止模型认错对象
- 结尾钉住"动作和场景保持不变":动作由参考视频带着走,这句防止换人时带动其他部分

第 6 步:输出参数对齐源视频,点运行
输出设置里把分辨率、帧率对齐源视频(本文源视频 2.3 秒、30 帧率),画面最干净、出片也最快。然后点「运行」(或 Ctrl+Enter)。本次实测:2.3 秒的片子约 4 分钟出片(20 步采样,每步约 9~11 秒),完成后自动存到 video 文件夹。
带声音的源视频:音频模式选「原声」
这一节是本篇独有、实测踩出来的经验,请直接照做:
- 如果源视频带音轨(手机拍的、下载的视频基本都带),导演台的音频模式不要用默认的「静音」——实测带音轨素材 + 静音模式会在保存阶段报内存错误崩溃(这是当前版本静音路径的缺陷,不是电脑配置问题)
- 把音频模式切成「原声」:出片稳定,还会把源视频的声音保留在成片里
- 不想要声音?用「原声」出完片,丢剪辑软件一键删音轨就行——比在导演台里崩一次省事得多

技巧
- 参考图质量就是成片质量:正面、清晰、光线均匀的照片换出来最稳;糊图、侧脸、遮挡多的图别指望脸能好看
- 源视频人物动作幅度大更直观:舞蹈、走路、挥手这类动作明显的素材,换人效果一眼能看出"动作没变、人换了"
- 低分辨率素材的脸会偏糊:0.2 百万像素这类低清短片,人物五官细节本来就少,属正常现象,想更精细就换清晰度更高的素材
- 人物跨度大也能换:性别、发型、服装全换都行——动作是参考视频给的,长相是参考图给的,两者互不干扰
常见问题
- 保存时报内存错误 / 成片没声音?音频模式切成「原声」重跑(见上文专节),别用「静音」处理带音轨素材
- 加载视频后时间线还是官方演示?重新点一次"加载视频",确认选的是 input 文件夹里你自己那个文件
- 输出画面比例不对?输出分辨率和帧率要和源视频一致,残留的演示参数(比如竖屏)要先改掉
- 换上去的人不像参考图?检查参考图本身够不够清晰正面;提示词里要写"参考图1"让模型认准是哪张图
- 换错人了(换了背景里其他人)?提示词里把目标人物的特征写足(衣服颜色、性别、位置),并明确"把视频里的【特征】换成参考图1里的【人物】"
小结
H3 参考视频生视频 = 参考视频给动作、参考图给人物,换人不换戏。一段 2.3 秒的黑衣男视频,喂一张古风女子照片,人物整个换掉,动作、节奏、镜头全程保留。记住两个要点:参考图选正面清晰照、提示词说清"把谁换成参考图1里的谁并保持动作不变";源视频带声音时音频模式选「原声」。到这里,导演台的图生视频、视频生视频、参考视频生视频三条路就齐了——原创、改妆、换角,一个导演台全包。