8月3日,MiniMax 把新一代视频模型 H3 开源了。Artificial Analysis 的榜单上,它的视频编辑能力排全球第一,文生视频第二,图生视频第三。全模态视频模型第一次开源,名次又这么靠前,想跑本地的人自然多。

能生成什么

H3 一次生成 4 到 15 秒的视频,音频是原生双声道,32kHz 采样,对白支持 11 种语言。模型按任务分两种,FL2VA 管首尾帧,给 0 张图就是文生视频,给 1 张是首尾帧生视频,给 2 张自动补中间动作。Ref2VA 管参考生成,最多吃进 9 张图、3 段视频、3 段音频当参考。

本地跑的是 768P

有一点得先说清楚。H3 整套系统拆三块,开源的只有中间的 H3-Base。管指令理解的 Context-IR 和管 2K 再生成的 Regenerate-2K,都只开放 API。本地能跑的是 768P,想要官方 2K 效果,得把结果连同素材交给两个托管 API 再生成一遍。这是官方划的线。

跑起来要什么条件

这模型挑机器。无 offload 的部署要 4 张 80GB GPU,多数人够不着。单卡只有两条路,开 CPU offload,系统内存得装 110GB 以上的权重,或者用 ComfyUI 的量化裁剪版,INT8 版 24GB 单卡就能跑。磁盘也别省,权重 130GB 起步,两个变体都下就翻倍。ComfyUI 要 0.30 以上,权重分两个目录放,缺一个都起不来,下载走魔搭比 HuggingFace 快。

速度

速度是短板。官方在 4 张 B300 上测过,FL2VA 生成 8.7 秒的片子要 87 秒,Ref2VA 更慢,15 秒的片段要 784 秒。我这边实测 480P 五秒的视频,5 到 10 分钟,具体看显卡。

价格

云 API 的价格也公布了,2K 0.8 元/秒,768P 更低,不到主流旗舰的三分之一。轻量使用的话,直接调 API 可能比折腾本地部署划算。商用前记得看一眼许可证,H3 用的是 MiniMax 自己的 Community License,允许商用,条款有条件。

一键整合包

全套资源我打包好了,工作流、模型权重、提示词模板都在里面,夸克网盘,解压双击 bat 就能用。

Minimax-H3视频生成模型一键整合包

ComfyUI模型及工作流

装之前记得把 ComfyUI 更新到最新版。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐