8GB显存跑MiniMax H3:FreeVideo开源,视频大模型装进笔记本
开源项目 FreeVideo 借助 Video DeltaNet,把 330 亿参数的 MiniMax H3 装进 8GB 显存笔记本并接入 ComfyUI;八卡 B200 上 14.4 秒 768p 视频约 9 秒出片,一周内连发多个版本。
不用再去租按秒计费的云端显卡——一个叫 FreeVideo 的开源项目,声称能在只有 8GB 显存、16GB 内存的普通电脑上,本地跑起 MiniMax H3。后者是 330 亿参数的开源视频模型,完整整合包动辄两百多 GB。据项目方介绍,FreeVideo 已经以 ComfyUI 插件的形式发布,Windows 和 Mac 都有一键安装包,Linux 走命令行,模型还支持离线安装。截至发稿,这个仓库在 GitHub 上已有约 1.4k Star。
让这件事成立的,不是把模型简单“压小”,而是同一批研究者给视频模型换了一套注意力结构。核心论文《Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation》在 9 月 17 日挂上 arXiv(编号 2609.20744),作者来自加州大学伯克利分校、Impossible 公司以及得克萨斯大学奥斯汀分校,第一作者 Haocheng Xi 是伯克利在读博士,师从 Kurt Keutzer。
为什么 H3 这么“难伺候”
要理解 FreeVideo 的价值,得先看清瓶颈在哪。据论文测算,在 MiniMax H3 的一次完整推理里,负责让画面上每个位置相互“打量”的注意力计算,占掉了去噪环节超过 85% 的运行时间;而这部分开销会随视频时长呈平方级增长——视频越长,越算不动。云端用八张 B200 可以硬扛,个人电脑显然不行。

把“全程紧盯”换成“近看远记”
Video DeltaNet(简称 VDN)的思路是让注意力分工。据 OpenVDN 官方博客,它把视频内部的注意力拆成两支:一支是滑动窗口的 Softmax 注意力,只让相邻几帧互相“仔细看”,保住纹理、轮廓和短期动作这些精细细节;另一支是双向线性注意力,把远处的帧压缩成一份固定大小的记忆,负责记住人物身份、场景布局和长程运动。为免丢掉首尾信息,VDN 还给第一帧和最后一帧加了两条“边界锚”,让每一帧都能参照开头与结尾,代价只是多出约 3.57% 的注意力密度。
更关键的是线性记忆的写入方式。传统线性注意力一次只处理一个 token,而视频是按帧推进的,一帧里成百上千个空间 token 同时到位。论文提出的 Video Delta Attention 改成“逐帧结算”:把整帧所有 token 的写入放进同一个方程一起求解,让相互重叠的方向在更新内部先“协商”,而不是各自记账。论文证明,这种更新对继承下来的旧记忆是“非扩张”的——连续几十帧累加,旧信息不会被某一帧意外放大而冲垮。据论文对比,在接近的延迟下,它的多项画质指标高于此前的稀疏注意力基线。 
数字,与它真正的门槛
速度是这套方案最直观的卖点。据官方数据,在八张 NVIDIA B200 上、配合 SGLang 推理栈,VDN-H3 用 8 步去噪在 6.9 秒内完成一段 14.4 秒、768p 视频的去噪,端到端约 9.0 秒——比视频本身还短;相比同等硬件上 50 步的原始密集 H3,提速约 14.5 倍。它同时支持文本、首帧、尾帧、首尾帧以及“类参考图生视频”等多种输入。
不过这些漂亮数字来自数据中心级显卡。真正把它送进笔记本的,是建立在 VDN-H3 之上的 FreeVideo:它会协调显存、内存和硬盘,按显卡自动选择权重精度——GeForce 与 RTX 30 系用 int8,工作站和数据中心卡用 FP8——再叠加权重流式加载、异步预取与分块计算,把峰值内存压下去。按官方说明,切换到 int8 后,一块 RTX 3090 生成 5 秒视频快了约 2.3 倍。

一周连发五个版本
FreeVideo 的迭代节奏也很“开源”:10 月 2 日正式开源,10 月 3 日加入社区 LoRA 支持;10 月 5 日上线 Light / Medium / High / Max 四档画质,并放出 Mac 预览版(已在 24GB 统一内存的 M5 Mac 上测试);10 月 6 日让生成的视频自带工作流——把它拖回 ComfyUI 画布,就能还原提示词、种子和参数,同时开放作品画廊;10 月 7 日又更新 int8 模型,并加入“先出半分辨率预览、满意再渲染完整版”的省时模式。
对本地创作者意味着什么
把 8GB 显存当成“下限”而不是“舒适区”,会更接近事实:它证明这条路走得通,但实际速度、时长与分辨率仍取决于具体硬件,更高画质档位需要更多时间等待。此外,模型权重沿用 MiniMax H3 社区许可,带有地区与用途限制,商用前需自行核对。尽管如此,方向已经清楚:开源视频模型正从“数据中心专属”变成“个人电脑可玩”,而对注意力结构的重构,正是这轮降门槛的关键推手。
信息来源:FreeVideo(GitHub) | Video DeltaNet 论文(arXiv:2609.20744) | OpenVDN 官方页
信息来源:GitHub