H3 文生视频上手:一句话,生成带声音的视频

2026-08-16 11:21 · 185 阅读
Minimax H3 实战 · 第 1 篇 / 共 20 篇 查看系列 →
H3 文生视频上手:一句话,生成带声音的视频

这个工作流能做什么

一句话说清楚:你写一段文字,它直接生成一段带声音的视频。不用拍、不用剪、不用配音——H3 生成画面的时候,把对白、音效、音乐一起"算"出来了,这是它和别的视频模型最大的不同。

这个官方流程(官流)是 H3 最标准、最稳定的玩法,整张工作流图只有 4 个要看的节点,特别适合第一次接触视频生成的新手。

第 1 步:启动整合包,打开工作流

双击 ComfyUI启动器.exe(或运行 run_nvidia_gpu.bat),等浏览器弹出 ComfyUI 界面后:

  1. 在左侧「工作流」列表里找到 AI星尘-Minimax H3 文件夹
  2. 打开 H3文生视频工作流(官流).json

H3 文生视频上手:一句话,生成带声音的视频-图1

打开后你会看到一张干净的流程图,最上方一行大字写着「AI星尘---Minimax-H3文生视频工作流(本地版)」。打开工作流后如果看到弹窗提示,直接点「载入」确认即可。

第 2 步:认识这张图(一共 4 个节点,别被吓到)

H3 文生视频上手:一句话,生成带声音的视频-图2

从右往左,只有 4 样东西:

  • 1. 蓝色大节点(MiniMax H3)——整张图的核心,你要写的提示词、要调的参数全在这一个节点上。别看它个头大,真正需要你碰的只有「prompt(提示词)」「duration(时长)」「noise_seed(随机种子)」三个框。
  • 2. 分辨率选择器(Resolution Selector)——选画面大小的,默认 16:9 宽屏、0.4(实际出图 864×480)。显存紧张的话先调成最小 0.2(608×352),后面跑通了再往上加。
  • 3. 保存视频(Save Video)——视频从这里输出,文件名前缀默认 video/MiniMax_H3,不用改。
  • 4. 三张黑色说明卡片——官方写的使用说明和模型清单,看热闹用,不影响运行。

中间的连线、小节点都是厂家封装好的(模型加载、采样、音频合成都在里面),不用管,也别动。

第 3 步:先把参数调到最低,跑通第一遍

视频生成很吃显存,第一次跑先把配置压到最低,确保能跑通:

  1. 分辨率选择器里选 0.2(最小档,608×352)
  2. 主节点上把 duration(时长)改成 5(默认是 5 秒,我们生成个 5 秒的短片试试手)

H3 文生视频上手:一句话,生成带声音的视频-图3

提示词保持官方自带的那段不动(一段英文,讲的是"雨夜都市屋顶追捕"的动作片分镜),然后点右下角或顶部的「执行」按钮。

H3 文生视频上手:一句话,生成带声音的视频-图4

第一次跑会先把 4 个模型加载进显存,然后开始逐帧生成。整个过程几分钟到十几分钟都正常(视频是逐帧算的,比图片慢得多,分辨率越低、时长越短越快)。跑完后点「保存视频」节点上的预览,就能看到一段约 5 秒、带声音的城市追捕短片。

H3 文生视频上手:一句话,生成带声音的视频-图5

MiniMax_H3_00002_.gif

🎧 注意戴上耳机——画面里真的有声音:脚步声、风声、城市环境音,甚至还有一下重音落点。

第 4 步:提示词怎么写(全文重点,看这里)

这段自带提示词就是 H3 的官方"范文",我们拆开看它的结构——照着这个结构写,你就能写出自己的视频:

① 第一段:整体风格一句话

告诉 H3 这是"什么样的片子":实拍电影感 / 动画 / 广告片 / 纪录片……再加画面风格(黄昏都市、浅景深、胶片颗粒、体积雾)。

例:实拍电影感、动作片预告片风格:黄昏的赛博都市,浅景深,胶片颗粒

② 第二段:场景和剧情概述

这段"发生了什么":谁、在哪、做什么。H3 会根据这段脑补出连贯的画面。

例:主角在摩天楼顶被追杀,从一栋楼顶跃向另一栋,身后追兵逼近

③ 第三段:分镜时间轴(最出效果的一段)

按秒切分镜头,每段写清楚镜头几、什么机位、画面里发生什么。官方样例是 5 秒 4 个镜头:

[0s-1.5s] 镜头1:高侧机位,主角在楼顶狂奔,追兵从门后出现
[1s-2.5s] 镜头2:主角腾空跃过楼间,慢动作,身后是车流光轨
[2.5s-4s] 镜头3:落地翻滚起身,低机位,阴影和雾气
[4s-5s] 镜头4:定格:跃向下一栋楼的瞬间剪影

(镜头时间可以重叠,H3 会自动衔接转场)

④ 第四段:镜头语言 + 音频设计 + 约束

补充剪辑节奏(硬切、不要淡入淡出)、声音设计(脚步声、环境音、音乐在哪一下重音),以及"不要什么"(无水印、无字幕、不要卡通渲染)。

新手提示:中文直接写就行。H3 用的 Qwen3-VL 语言模型中文理解很强,上面这套结构全部用中文写也没问题。怕写不好,就先抄结构、换内容:把"追捕"换成"晨跑""婚礼""星际旅行",把场景词换掉,5 分钟就能出一段自己的视频。

第 5 步:跑通之后,再慢慢加码

第一遍跑通(5 秒、0.2 分辨率)之后,再按这个顺序往上加:

  • 时长(duration):5 秒起步,想长一点就填 10,最长约 15 秒。时长越长生成越慢,别一上来就挑战 15 秒。
  • 分辨率:从 0.2 一档一档往上加——0.4(864×480)是官方默认档,0.98(1344×768)接近高清。加到哪一档开始卡、报错,就退回上一档用。
  • 随机种子(noise_seed):默认是随机的,每次生成都不同;看到特别满意的作品,把当时的种子数字记下来,下次填回去就能复现。

判断标准很简单:哪一档跑不稳,就降一档。视频生成吃显存,够用就行,画质差距在手机上根本看不出来。

第 6 步:视频生成到哪了

所有生成的视频都保存在整合包的 ComfyUI/output/video/ 目录下,文件名形如 MiniMax_H3_00001.mp4。也可以在「保存视频」节点上右键 → Open,直接打开文件夹。

新手常见问题

  • 生成要多久?几分钟了还没好,正常吗?正常。视频是逐帧算的,20 步采样 × 上百帧,5 秒视频也要几分钟到十几分钟。分辨率越低、时长越短越快。
  • 跑着跑着 ComfyUI 自动退出 / 断开了?大概率是内存或显存不够。把分辨率调到最小 0.2、时长控制在 5 秒内,关闭浏览器多余标签和其他占内存的程序再试;还不行就重启电脑释放内存。
  • 生成完没有声音?检查一下有没有误删节点——这个工作流里音频是自动合成的,不需要任何额外操作;换个视频播放器试试(某些播放器不播音频轨)。
  • 最多只能 15 秒?对,这是 H3 模型本身的上限。想要更长的片子,可以用「视频插帧」工作流延长,或者把多段生成结果剪接起来。
  • 显卡一般能跑吗?整合包里是 Int8 量化版模型,16GB 显存可流畅运行;8GB 显存按本教程最低配置(0.2 分辨率 + 5 秒)也能尝试。
  • 提示词用中文还是英文?中文完全可以,结构建议照上面的四段式写;英文效果更稳(训练数据多),但中文已经够用。

想直接开跑?

本教程用的是 AI星尘 Minimax-H3 整合包,模型环境全部内置、解压即用;已经有 ComfyUI 环境的,也可以单独购买 AI星尘 Minimax-H3 整合包 单独工作流(16 个工作流文件,导入即用)。

登录后分享可赚邀请积分
评论 (0)

登录后才能发表评论

去登录