MiniMax H3社区插件发布:CPU钉住注意力,8GB显存跑Ref2VA长视频
社区发布MiniMax H3 SeqAttn插件,用CPU钉住Q/K/V与Qwen BF16卸载,把15.7万token的Ref2VA生成压进8GB显存,极大降低H3本地部署门槛。
一个在32GB显存的RTX 5090上、刚跑完第一次QKV投影就爆显存的任务,如今被一个上线仅两天的社区插件压进了8GB。8月23日,社区开发者renlililoli在GitHub发布MiniMax H3 SeqAttn插件,官方README将其定位为「针对原生ComfyUI MiniMax-H3模型的精确CPU背书流式注意力」,直接把长视频本地生成的门槛拽了下来。
开源之后的那道显存墙
据MiniMax官方公告,H3于8月2日正式开源,是一套能统一理解文本、图像、视频与音频的全模态生成系统,可输出最高2K分辨率、最长15秒、带原生立体声音频的视频,核心H3-Omni-Transformer为33B参数的dense单流Transformer。但官方同时坦言:模型训练后期已引入原生稀疏注意力,首个开源版本却只提供全注意力推理,稀疏实现「将在后续更新中发布」。
分辨率与时长的提升,让全注意力推理的显存开销快速膨胀——这正是社区想填的坑。据优米网对8月7日Reddit AMA的报道,MiniMax团队当时表示计划「近期给社区提供一个相对保守的稀疏注意力参考实现」,第一目标不是夸张的加速数字,而是无可感知的质量损失。在官方版本落地前,SeqAttn交出了一份「确定性」答卷。

157,526个token,7,696 MiB峰值
插件由两条补丁组成:SeqAttn模型补丁把长序列隐状态与完整Q/K/V张量钉在CPU内存中;Qwen BF16补丁则以有界的BF16激活和按层卸载权重运行文本与视觉条件编码。两者都无需转换现有ComfyUI检查点,支持T2VA、FL2VA、Ref2VA三种布局。
据GitHub仓库实测数据(2026年8月21日UTC单次运行,作者注明无误差棒),一个1344x768、243帧参考加243帧输出的Ref2VA生成,把源视频重绘为粉色手绘童话世界,文本、参考视频、音频与目标视频合计157,526个token,全程GPU内存峰值仅7,696 MiB(RTX 5090上测得),距8,192 MiB目标还剩496 MiB余量;输出为H.264、24fps、10.125秒视频。5秒定向编辑版本(124帧、81,467个token)同样录得7,696 MiB峰值。
代价是时间与内存:20步去噪耗时5,757.48秒(约96分钟),完整管线约100分钟,CPU内存峰值61.06 GiB;5秒编辑版去噪约38.5分钟,CPU峰值52.32 GiB。开发者毫不讳言这是「capacity result, not a native-attention speedup claim」——用CPU内存与运行时长,换取有界的GPU工作集。

显存换时间,值不值
对比之下,作者的对照组很能说明问题:相同157K token规模的原生ComfyUI运行,在32GB RTX 5090上于第一次QKV投影即爆显存,采样进程峰值高达31,590 MiB。
「能跑」与「跑多快」始终是两回事。据什么值得买8月21日的文章,社区对H3的普遍体验是「8G显存能跑,但一条15秒视频要40分钟」,微博上流传最广的一条评测帖甚至建议「任何有超过8GB显存电脑的人都试试本地部署minimaxh3」;博客园8月8日的横评则吐槽原生推理「随便一个5秒视频就要跑15~20分钟,还容易爆显存」。SeqAttn不追求速度,它的价值在于让长序列Ref2VA这类此前「根本起不来」的任务,在8GB档位上有了一条能完整跑完的确定性路径——哪怕要等上一个多小时。

想上手,先看清这些条件
安装并不复杂:ComfyUI Manager搜索「MiniMax H3 SeqAttn」即可,或git clone仓库到custom_nodes目录,无需额外Python包。但门槛实实在在——据README,要求ComfyUI≥0.30.0、Linux加NVIDIA CUDA、Python≥3.10、batch size固定为1,且需要足够的CPU DRAM容纳完整隐状态与Q/K/V存储;注意力与Qwen激活路径无论检查点存储精度如何,一律走BF16。模型权重需自行从Comfy-Org/MiniMax-H3下载INT8 ConvRot检查点与Qwen3-VL 32B NVFP4 AWQ文本编码器。
限制同样明确:目前不支持LoRA、NVMe激活回退与多卡执行;自定义节点采用GPL-3.0,附带的SeqAttn运行时为Apache-2.0。在官方稀疏注意力与低步数版本都还没给时间表、第三方Turbo LoRA又被评测出明显质量退化(据优米网AMA报道)的当口,这个插件给了8GB用户一个「先跑起来」的理由——虽然它换来的,可能只是一杯等得起凉茶的耐心。

信息来源
信息来源:GitHub