H3 单图生视频教程(加速版):图生视频提速,出片更快
这篇讲什么
上一篇我们用官方标准版(官流)跑通了图生视频——一张图生成一段带声音的视频。这一篇讲它的加速版:同样的玩法,出片更快,而且它自带一段官方中文范文,是学习图生视频提示词的最好素材。
加速版在图生视频系列里的名字叫「H3单图生视频工作流(加速)」,一张图做参考生成视频。提速靠的还是那三件套:int8 量化模型 + SageAttention 注意力补丁 + TE 蒸馏(原理在《文生视频加速》那篇讲过,这里直接用就行)。
第 1 步:打开加速版工作流
双击 ComfyUI启动器.exe(或运行 run_nvidia_gpu.bat),等浏览器弹出 ComfyUI 界面后:
- 在左侧「工作流」列表打开 AI星尘-Minimax H3 文件夹
- 选择 H3单图生视频工作流(加速).json

打开后是一张 20 多个节点的图,看起来比官流复杂很多。别慌,和文生加速版一样,要你动手的只有 4 个地方,其余全部自动。

第 2 步:认识 4 个要管的节点
1. 「加载图片」(Load Image)——你的参考图
双击节点,在弹出的窗口里上传你想让它动起来的图片,选完节点上会显示缩略图。加速版默认内置的是一张古风人物图(白衣公主),和官流内置的游戏鼠标样例不一样——你可以先用它跑通,再换成自己的图。

2. 「Input Text (Prompt)」提示词节点——重点中的重点
这是加速版比官流"高级"的地方:它默认自带一段完整的中文图生视频提示词(古风公主回身短片),这不是随便写的样例,而是官方标准写法,下一章逐段拆给你看。

3. 「Float (Duration)」时长
单独一个小数字框,默认 5(秒)。填 10、15 就是更长的片。
4. 「Resolution Selector」分辨率
注意:加速版默认是 2:3 竖版、0.4 档(官流默认 1:1 方形)。想要横版点开下拉选「16:9」。

图里剩下的(帧数自动计算、采样器、双 VAE 解码、视频合成、加速补丁)全部自动连好,不用管,也别动。
第 3 步:官方中文范文拆解(图生视频提示词终极模板)
提示词节点里默认装着的这段古风提示词,是图生视频提示词的标准写法,原文如下:
@图片0 作为人物样貌、古装服饰、宫廷石桥樱花场景、光影配色参考
生成一段 5 秒、16:9、2K、原生立体声古风文戏短片
影片目标与核心概念:皇室公主驻足回身,与身后皇子遥遥对视,
无声流露暗藏的疏离心绪,完成一次微妙的情绪转折。
固定人物、主体、场景、道具与一致性:白衣鎏金凤冠公主,黑衣绣金皇子,
三名黑衣侍卫;古皇宫白玉石桥、湖面、盛放樱花、古典宫灯,
人物服饰、妆容、场景色调严格匹配参考图。
0-1.5 秒:中景镜头,公主背对镜头缓步向前行走,衣袂随微风轻扬,
皇子与侍卫一行人跟在后方缓步随行。
1.5-3.2 秒:公主脚步缓缓停下,缓慢转过上半身,侧脸面向后方,目光落向皇子。
3.2-4.2 秒:镜头缓慢推近至中近景,公主神色平静淡漠,眼底暗藏怅然;
皇子止步站立,安静回望公主,二人隔空对视,无台词。
4.2-5 秒:公主轻轻收回目光,微微垂眸,定格在落寞沉静的表情,
完成情绪收尾,画面停留 0.5 秒余韵。
剪辑、摄影、表演规则:平缓推拉运镜,无剧烈晃动;
人物动作舒缓优雅,微表情细腻克制,不出现夸张神态;
全程保持人物造型与环境统一。
视觉风格与材质:超写实国风 CG,柔和春日自然光,漫射阳光穿过樱花树枝,
布料刺绣质感细腻,水面轻微波光,电影级景深。
声音设计:轻柔古风弦乐背景音乐,微风拂动花瓣、衣料摩擦细微声响,
远处宫阙隐约环境白噪音,全程无人物对白。
收束人物、镜头与结尾一致性:最终画面定格垂眸的公主,
皇子立于桥道远端,拉开二人距离,强化彼此隔阂的氛围,叙事闭环。拆开看,它其实是9 层结构,一层比一层细,照着写你就是专业导演:
- 第一行:参考图声明——
@图片0是加速版对参考图的称呼,告诉模型"下面说的东西都基于这张图"。声明它管什么:人物样貌、服饰、场景、光影。 - 一句话总目标——几秒、什么比例、什么风格、什么类型片。给模型一个"产品规格"。
- 影片目标与核心概念——你要表达什么情绪/情节。这是它和你互动的地方,AI 视频最怕"没想法"。
- 固定一致性清单——把不能变的东西全部列出来:谁、穿什么、带什么、场景有哪些元素,并明确"严格匹配参考图"。这就是图生视频不跑偏的保险。
- 分镜时间轴——按秒切镜头,每段写清:景别(中景/近景)、谁在做什么、镜头怎么动。时间可以不留缝,模型会自动衔接。
- 剪辑、摄影、表演规则——运镜节奏、表演幅度、禁忌(无剧烈晃动、不夸张)。
- 视觉风格与材质——画风、光线、质感细节。
- 声音设计——音乐风格、环境音、要不要对白。H3 会按这个生成音频。
- 收束一致性——结尾画面落在哪、叙事闭环。防止烂尾。
新手中文模板(把上面结构压缩成必填 5 行):
@图片0 作为[人物/主体]、[服饰/材质]、[场景]、[光影配色]参考
生成一段 [5] 秒、[16:9]、原生立体声[风格]短片
固定一致性:[谁、穿什么、场景有什么],严格匹配参考图
[0-2 秒]:[景别]镜头,[做什么]
[2-5 秒]:[景别]镜头,[做什么]
声音设计:[音乐风格]、[环境音]、[有无对白]怕写不好?最低限度抄前 4 行(参考声明 + 总目标 + 一致性 + 时间轴),出来的效果就远超"图片放上去不动"。
第 4 步:跑通第一遍(完整操作流程)
- 确认「加载图片」里是你想用的图(先用内置古风样例也行)
- 提示词先用节点里自带的中文范文跑一遍,感受效果,再换成自己的
- 时长 5 秒、分辨率默认 2:3 竖版先不动
- 点右下角或顶部的「执行」按钮
第一次跑会先加载模型(主模型 + 文本模型 + 双 VAE,几分钟),然后逐帧生成(5 秒短片约 124 帧)。完成后点「保存视频」节点预览,就能看到古风公主在樱花石桥上回身抬眸,还带着古风弦乐和环境音。


第 5 步:参数与技巧
- 时长:改「Float (Duration)」——5/10/15 秒都行,上限 15 秒。帧数自动换算(5 秒约 124 帧),不用管。
- 分辨率比例:视频比例最好和图片一致——竖图用默认 2:3,方图选 1:1,横图选 16:9。比例差太远会拉伸或裁切。
- 分辨率档位:0.2(最小)→ 0.4(默认)→ 0.6 → 0.98(接近高清)。显存紧张就 0.2,哪档跑不稳降一档。
- 随机种子:默认随机;出好片记下种子数字,填回去可复现。
- 高级功能:音频参考——图里有个「加载音频」(Load Audio)节点,可以接一段音乐/人声当声音参考,让视频音频风格跟着它走。留空也能正常生成,新手先不管。

常见问题
- 生成的视频和参考图不一样?参考图要清晰、主体突出;提示词里别写和图片矛盾的内容。背景复杂的图先抠图再生成(用包里的抠图工作流)。
- 画面被拉伸/裁切?视频比例和图片比例差太远,把分辨率比例调成和图片一致。
- 图片不动 / 动得生硬?动作要写具体("杯口冒热气"强过"杯子很好看");分镜时间轴里带镜头运动(推近/环绕/平移)。
- 生成到一半报错 / 卡住?显存或内存压力:分辨率降到 0.2、时长 5 秒、关掉多余程序,重启 ComfyUI 再跑。
- 加速版比官流快多少?模型加载和逐帧生成都能感觉到差异;同一张图同一段提示词,两个工作流各跑一遍对比最直观。
- 能生成 15 秒以上?不能,H3 上限 15 秒;要更长的用「视频插帧」工作流或分段拼接。
想直接开跑?
本教程用的是 AI星尘 Minimax-H3 整合包(官流、加速版、全部 16 个工作流和模型环境已内置,解压即用);已有 ComfyUI 环境的,可以单独购买 AI星尘 Minimax-H3 整合包 单独工作流(16 个工作流文件,导入即用)。