MiniMax-H3的ComfyUI轻量版发布:低显存GPU也能本地生成立体声视频
Comfy-Org发布MiniMax-H3的ComfyUI轻量版,提供BF16、INT8、FP8与pruned版本,低显存GPU也能本地生成带立体声的视频。
据日本媒体テクノエッジ(TechnoEdge)8月15日报道,ComfyUI官方组织Comfy-Org已在Hugging Face发布视频生成模型MiniMax-H3的ComfyUI再配布版。该版本在BF16基础上,新增了INT8、FP8量化版以及被称为“pruned”的轻量精简版,显著降低了显存门槛,让低VRAM显卡也有机会在本地直接生成“视频+立体声音频”的全模态内容。
MiniMax-H3:可同时生成视频与立体声音频的全模态模型
MiniMax-H3是MiniMax于2026年8月3日开源的全模态视频生成模型,参数规模约331亿(33.1B)。与多数只能产出“无声”视频的模型不同,H3能够同时生成画面与音频——输出时长为4至15秒、帧率为24FPS,声音为32kHz立体声,对白支持日语、英语、中文等11种语言,并覆盖21:9到9:16的多种宽高比。据报道,开源当天ComfyUI即完成Day-0原生适配,开发者可直接从Hugging Face下载权重,并通过ComfyUI工作流进行部署。

再配布版:BF16/INT8/FP8与pruned轻量版齐上阵
本次Comfy-Org发布的再配布版,针对本地推理进行了重新打包。除保留高精度的BF16版本外,还提供了INT8、FP8量化版,以及将AdaLN调制网络(约占模型参数四成)替换为预计算查找表的pruned精简版。据报道,pruned版可使模型体积从约34GB缩减至约20GB,且Comfy-Org方面称并未带来明显的质量损失。与此同时,文本编码器一侧也提供了INT8等轻量版本,进一步压缩了整体显存占用,为低配置设备留出更多运行空间。

显存门槛降低:12GB级显卡也有机会
在H3开放权重发布时,ComfyUI就曾表示该模型有望在12GB显存的RTX 3060上运行;此次量化与精简版的推出进一步放大了这一可能。完整BF16版通常需要24GB以上的显存,而INT8、pruned等版本可将需求压缩至更低水平,据相关整理,约12GB显存的显卡配合充足系统内存即可尝试本地生成。这也带动了社区生态的快速跟进——据ComfyUI Wiki报道,在开放权重发布次日,Hugging Face上便出现了GGUF Q2-Q5、INT4/INT8与NVFP4等众多社区量化版本,并捆绑了现成的ComfyUI工作流,供不同规格显卡的用户按需取用。

点评:本地化加速,仍有权衡待验证
从云端API到消费级显卡,MiniMax-H3的本地化进程在两周内显著提速。量化与精简的组合有效降低了全模态视频生成的上手门槛,让更多创作者能够在本地、低成本且相对私密的环境下试验“带声音的AI视频”。不过需要留意的是,低显存方案往往伴随着文件下载体积与生成速度的权衡,且立体声音频在不同量化档位下的实际表现,仍待用户实际体验验证。

信息来源:テクノエッジ TechnoEdge「動画生成AI『MiniMax-H3』のComfyUI向け軽量版が登場、少ないVRAMでも動作」(2026年8月15日)
信息来源:テクノエッジ TechnoEdge