H3 单图生视频教程(加速版):图生视频提速,出片更快

2026-08-17 11:21 · 222 阅读
Minimax H3 实战 · 第 4 篇 / 共 20 篇 查看系列 →
H3 单图生视频教程(加速版):图生视频提速,出片更快

这篇讲什么

上一篇我们用官方标准版(官流)跑通了图生视频——一张图生成一段带声音的视频。这一篇讲它的加速版:同样的玩法,出片更快,而且它自带一段官方中文范文,是学习图生视频提示词的最好素材。

加速版在图生视频系列里的名字叫「H3单图生视频工作流(加速)」,一张图做参考生成视频。提速靠的还是那三件套:int8 量化模型 + SageAttention 注意力补丁 + TE 蒸馏(原理在《文生视频加速》那篇讲过,这里直接用就行)。

第 1 步:打开加速版工作流

双击 ComfyUI启动器.exe(或运行 run_nvidia_gpu.bat),等浏览器弹出 ComfyUI 界面后:

  1. 在左侧「工作流」列表打开 AI星尘-Minimax H3 文件夹
  2. 选择 H3单图生视频工作流(加速).json

60031357-8f62-49c6-a4cf-bea46b8de4d9.png

打开后是一张 20 多个节点的图,看起来比官流复杂很多。别慌,和文生加速版一样,要你动手的只有 4 个地方,其余全部自动。

c8fa263a-e424-491c-9fc3-da41a4071dd1.png

第 2 步:认识 4 个要管的节点

1. 「加载图片」(Load Image)——你的参考图

双击节点,在弹出的窗口里上传你想让它动起来的图片,选完节点上会显示缩略图。加速版默认内置的是一张古风人物图(白衣公主),和官流内置的游戏鼠标样例不一样——你可以先用它跑通,再换成自己的图。

67645ec0-1391-4ef1-b671-64bb095b1acf.png

2. 「Input Text (Prompt)」提示词节点——重点中的重点

这是加速版比官流"高级"的地方:它默认自带一段完整的中文图生视频提示词(古风公主回身短片),这不是随便写的样例,而是官方标准写法,下一章逐段拆给你看。

f6efb5c5-d4d3-4237-a68b-94f9f800474f.png

3. 「Float (Duration)」时长

单独一个小数字框,默认 5(秒)。填 10、15 就是更长的片。

4. 「Resolution Selector」分辨率

注意:加速版默认是 2:3 竖版、0.4 档(官流默认 1:1 方形)。想要横版点开下拉选「16:9」。

24364c99-d6d8-435e-9cc1-83defe648b6f.png

图里剩下的(帧数自动计算、采样器、双 VAE 解码、视频合成、加速补丁)全部自动连好,不用管,也别动。

第 3 步:官方中文范文拆解(图生视频提示词终极模板)

提示词节点里默认装着的这段古风提示词,是图生视频提示词的标准写法,原文如下:

@图片0 作为人物样貌、古装服饰、宫廷石桥樱花场景、光影配色参考
生成一段 5 秒、16:9、2K、原生立体声古风文戏短片
影片目标与核心概念:皇室公主驻足回身,与身后皇子遥遥对视,
无声流露暗藏的疏离心绪,完成一次微妙的情绪转折。
固定人物、主体、场景、道具与一致性:白衣鎏金凤冠公主,黑衣绣金皇子,
三名黑衣侍卫;古皇宫白玉石桥、湖面、盛放樱花、古典宫灯,
人物服饰、妆容、场景色调严格匹配参考图。
0-1.5 秒:中景镜头,公主背对镜头缓步向前行走,衣袂随微风轻扬,
皇子与侍卫一行人跟在后方缓步随行。
1.5-3.2 秒:公主脚步缓缓停下,缓慢转过上半身,侧脸面向后方,目光落向皇子。
3.2-4.2 秒:镜头缓慢推近至中近景,公主神色平静淡漠,眼底暗藏怅然;
皇子止步站立,安静回望公主,二人隔空对视,无台词。
4.2-5 秒:公主轻轻收回目光,微微垂眸,定格在落寞沉静的表情,
完成情绪收尾,画面停留 0.5 秒余韵。
剪辑、摄影、表演规则:平缓推拉运镜,无剧烈晃动;
人物动作舒缓优雅,微表情细腻克制,不出现夸张神态;
全程保持人物造型与环境统一。
视觉风格与材质:超写实国风 CG,柔和春日自然光,漫射阳光穿过樱花树枝,
布料刺绣质感细腻,水面轻微波光,电影级景深。
声音设计:轻柔古风弦乐背景音乐,微风拂动花瓣、衣料摩擦细微声响,
远处宫阙隐约环境白噪音,全程无人物对白。
收束人物、镜头与结尾一致性:最终画面定格垂眸的公主,
皇子立于桥道远端,拉开二人距离,强化彼此隔阂的氛围,叙事闭环。

拆开看,它其实是9 层结构,一层比一层细,照着写你就是专业导演:

  1. 第一行:参考图声明——@图片0 是加速版对参考图的称呼,告诉模型"下面说的东西都基于这张图"。声明它管什么:人物样貌、服饰、场景、光影。
  2. 一句话总目标——几秒、什么比例、什么风格、什么类型片。给模型一个"产品规格"。
  3. 影片目标与核心概念——你要表达什么情绪/情节。这是它和你互动的地方,AI 视频最怕"没想法"。
  4. 固定一致性清单——把不能变的东西全部列出来:谁、穿什么、带什么、场景有哪些元素,并明确"严格匹配参考图"。这就是图生视频不跑偏的保险。
  5. 分镜时间轴——按秒切镜头,每段写清:景别(中景/近景)、谁在做什么、镜头怎么动。时间可以不留缝,模型会自动衔接。
  6. 剪辑、摄影、表演规则——运镜节奏、表演幅度、禁忌(无剧烈晃动、不夸张)。
  7. 视觉风格与材质——画风、光线、质感细节。
  8. 声音设计——音乐风格、环境音、要不要对白。H3 会按这个生成音频。
  9. 收束一致性——结尾画面落在哪、叙事闭环。防止烂尾。

新手中文模板(把上面结构压缩成必填 5 行):

@图片0 作为[人物/主体]、[服饰/材质]、[场景]、[光影配色]参考
生成一段 [5] 秒、[16:9]、原生立体声[风格]短片
固定一致性:[谁、穿什么、场景有什么],严格匹配参考图
[0-2 秒]:[景别]镜头,[做什么]
[2-5 秒]:[景别]镜头,[做什么]
声音设计:[音乐风格]、[环境音]、[有无对白]

怕写不好?最低限度抄前 4 行(参考声明 + 总目标 + 一致性 + 时间轴),出来的效果就远超"图片放上去不动"。

第 4 步:跑通第一遍(完整操作流程)

  1. 确认「加载图片」里是你想用的图(先用内置古风样例也行)
  2. 提示词先用节点里自带的中文范文跑一遍,感受效果,再换成自己的
  3. 时长 5 秒、分辨率默认 2:3 竖版先不动
  4. 点右下角或顶部的「执行」按钮

第一次跑会先加载模型(主模型 + 文本模型 + 双 VAE,几分钟),然后逐帧生成(5 秒短片约 124 帧)。完成后点「保存视频」节点预览,就能看到古风公主在樱花石桥上回身抬眸,还带着古风弦乐和环境音。

76aaa080-a1aa-4e39-9e52-87c21202c661.png

图生视频.gif

第 5 步:参数与技巧

  • 时长:改「Float (Duration)」——5/10/15 秒都行,上限 15 秒。帧数自动换算(5 秒约 124 帧),不用管。
  • 分辨率比例:视频比例最好和图片一致——竖图用默认 2:3,方图选 1:1,横图选 16:9。比例差太远会拉伸或裁切。
  • 分辨率档位:0.2(最小)→ 0.4(默认)→ 0.6 → 0.98(接近高清)。显存紧张就 0.2,哪档跑不稳降一档。
  • 随机种子:默认随机;出好片记下种子数字,填回去可复现。
  • 高级功能:音频参考——图里有个「加载音频」(Load Audio)节点,可以接一段音乐/人声当声音参考,让视频音频风格跟着它走。留空也能正常生成,新手先不管。

8eb9c8b2-3e4e-4a61-8a9a-9764139f7cf5.png

常见问题

  • 生成的视频和参考图不一样?参考图要清晰、主体突出;提示词里别写和图片矛盾的内容。背景复杂的图先抠图再生成(用包里的抠图工作流)。
  • 画面被拉伸/裁切?视频比例和图片比例差太远,把分辨率比例调成和图片一致。
  • 图片不动 / 动得生硬?动作要写具体("杯口冒热气"强过"杯子很好看");分镜时间轴里带镜头运动(推近/环绕/平移)。
  • 生成到一半报错 / 卡住?显存或内存压力:分辨率降到 0.2、时长 5 秒、关掉多余程序,重启 ComfyUI 再跑。
  • 加速版比官流快多少?模型加载和逐帧生成都能感觉到差异;同一张图同一段提示词,两个工作流各跑一遍对比最直观。
  • 能生成 15 秒以上?不能,H3 上限 15 秒;要更长的用「视频插帧」工作流或分段拼接。

想直接开跑?

本教程用的是 AI星尘 Minimax-H3 整合包(官流、加速版、全部 16 个工作流和模型环境已内置,解压即用);已有 ComfyUI 环境的,可以单独购买 AI星尘 Minimax-H3 整合包 单独工作流(16 个工作流文件,导入即用)。

登录后分享可赚邀请积分
评论 (0)

登录后才能发表评论

去登录