跳到正文
返回

MiniMax H3 本地部署完整教程


一、MiniMax H3 是什么?

MiniMax 于 2026 年 8 月 3 日正式开源 H3——这是一个通用全模态生成系统,不是单纯的”文生视频”模型。它能够统一理解由文本、图像、视频、音频构成的多模态上下文,并直接生成带原生立体声音频的视频。

核心能力一览

能力参数
输出时长4 ~ 15 秒
最高分辨率2K
音频生成与画面同步生成,32kHz 立体声(非后期配音)
语言支持中、英、日、韩、法等 11 种语言的口型与语音
榜单成绩Artificial Analysis:视频编辑全球第一,文生视频第二,图生视频第三

它基于全新的 H3-Context-IR 架构,与上一代 Hailuo 01 / 02 完全不同。此外,全能版(无限制版)模型也已在社区发布,相比官方版几乎没有内容限制,创意发挥空间更大。

效果示例(示意图)

H3 生成效果示例


二、显存到底要多少?(先看这段,再决定下载哪个模型)

网上普遍流传”8G 显存也能跑”,这句话没错,但有条件。以下是目前公开实测数据的整理:

配置显存系统内存实测表现
稳定跑通配置12G32G + NVMe 固态5 秒 480p / 20 步 ≈ 5 分钟
官方未量化版验证32G×2(共 64G)约 384G5 秒 1344×768 / 50 步 ≈ 9.3 分钟

为什么 12G 显存能跑 40 多 G 的模型? 因为 ComfyUI 采用按层动态调度(offload):需要哪一层就把哪一层搬进显存,其余留在内存和硬盘。显存不够不会直接报错,只是变慢。

8G 能不能跑? 能,但要靠更激进的量化(Q2、Q3)+ 大量 offload,出片时间会明显拉长,而且低量化对画质有实打实的损伤。如果你是 8G 显卡,建议:

量化版本怎么选(关键)

显存推荐量化
24G 及以上Q8 或官方 INT8 / NVFP4
16GQ5 或 Q4
12GQ4
8GQ3,或混合精度 Q2

三、部署完整教程(五步走)

准备:升级 ComfyUI

H3 需要 ComfyUI 0.27 或更高版本,老版本没有对应的原生节点,这一步跳过后面全是坑。

ComfyUI 启动界面

如果你之前装过 ComfyUI 桌面版,务必升级到最新版;用整合包的,直接用启动器里的”更新”功能。更新完启动一次,在右下角确认版本号


第一步:下载安装 ComfyUI

  1. 打开 ComfyUI 官网/下载入口,下载对应系统的客户端
  2. 双击安装包,一路”下一步”,保持默认设置装完
  3. 打开 ComfyUI,界面左侧有”模板”入口——后面下模型、导工作流都从这里进

第二步:选择并下载官方模型

在 ComfyUI 的模型下载中心 / 模板中心,有 3 种 MiniMax H3 开源模型:

ComfyUI 模型下载中心

按需下载。生成分辨率建议设小一点(如 480p),可以大幅提升生成速度;生成完成后,再用高清放大工具提升到 1080p / 2K / 4K(工具见文末资源区)。


第三步:下载全能版(无限制)模型

想要更自由的创意空间,可以下载全能版模型。它有 3 个文件:

文件体积说明
BF16 满血版约 47.97G画质最高,显存要求高
量化版约 24.55G家用消费级推荐,效果也不错
NVFP4 量化版较小8G 显存专用

完整文件列表(HuggingFace 上的 4 个文件):

H3 越狱模型文件列表

下载渠道:HuggingFace / 整合包 / 网盘(见文末资源区)


第四步:安装工作流节点 + 加载工作流

  1. 下载 ComfyUI-MiniMax-H3-Guide 工作流节点(GitHub,见资源区),放进 ComfyUI 的 custom_nodes/ 目录
  2. 重启 ComfyUI
  3. 下载工作流 JSON 文件(GGUF 仓库一般自带,类似 MiniMax FL2V GGUF (WORKFLOW).json),直接拖进 ComfyUI 界面即可加载

工作流节点界面(加载工作流后)

加载后检查这几个节点:

节点选择
Unet Loader (GGUF)选你下载的主模型
CLIP Loader (GGUF)选 qwen3vl 文本编码器
VAE Loader两个:视频 VAE 和音频 VAE,别接反
分辨率和帧数第一次跑先设 480p、5 秒

节点全部变绿、没有报红,就可以点生成了。


第五步:文件放置目录(必须放对)

模型文件必须放在正确位置,否则加载报错:

文件放置目录
主模型(如 MiniMax-H3-FL2VA-Q4_K_M.gguf)models/unet/
文本编码器(qwen3vl_32b_minimax_h3_Q4_K_M.gguf)models/text_encoders/
视频 VAE(minimax_h3_video_vae_fp16.safetensors)models/vae/
音频 VAE(必须 fp32:minimax_h3_audio_vae_fp32.safetensors)models/vae/

⚠️ 注意:音频 VAE 必须是 fp32 版本!用 fp16 会出现音画不同步或者干脆没声音(亲身踩过的坑)。

另外:如果走官方原生路线,模型权重需要同时放在 models/MiniMax-H3/(单文件权重)和 models/diffusers/MiniMax-H3/(分片版本,含 config.json)两个目录,缺一个都会报错。


第六步:第一次生成

  1. 上传一张图(图生视频)或输入提示词(文生视频)
  2. 分辨率设 480p、时长 5 秒、步数 20 步
  3. 点运行

工作流节点(图片输入)

第一次会非常慢——因为要把权重从硬盘加载进来。8G~12G 显存的机器,5 秒 480p / 20 步,做好等 8~15 分钟的心理准备。第二次开始会快很多(部分权重已缓存到内存)。


四、提示词进阶指南(决定出片质量的关键)

跑通只是开始,真正决定出片质量的是提示词。H3 能听懂镜头语言,写法和以前不同。

1. 写”分镜”,不要写”标签”

以前 SD 那套关键词堆砌在 H3 上效果一般。H3 更吃完整的场景描述 + 镜头调度

❌ 不好的写法:

一个女人,咖啡馆,下雨,电影感,8k,高质量

✅ 好的写法:

黄昏的咖啡馆靠窗位置,窗外下着小雨。一位穿米色针织衫的女性正低头搅拌咖啡,镜头从她的手部特写缓慢上摇至面部,她抬头看向窗外,嘴角微微上扬。暖色调室内灯光,窗外冷色调环境光形成对比。背景音:雨声、咖啡杯轻碰声、隐约的爵士乐。

区别在于:第二种把画面、动作、镜头运动、光线、声音全部交代清楚了。H3 的音频跟画面一起生成——你不写声音,它就自己猜,猜出来的十有八九不是你要的。

2. H3 生成的”分镜”画面示例

H3 生成的分镜示例

3. 镜头运动直接用术语

推、拉、摇、移、跟、升降,这些术语 H3 都认。也可以写英文:

想要稳定的运镜就写明白,别指望它读心。

4. 角色一致性靠 Ref2VA

这是 H3 最实用的功能:用 Ref2VA 分区,喂进去同一个角色的多张参考图(最多 9 张,建议 3~5 张不同角度),再配一段语音参考,就能做出跨镜头同一个人、同一个声音的连续片段。

做口播、系列内容、虚拟主播,这个功能直接砍掉一大半工作量。

经验:参考图的质量比数量重要。5 张清晰的正侧面照,效果远好过 9 张糊图。

5. 15 秒不够用怎么办

单次最长 15 秒是硬限制。想做长片,用尾帧接首帧的方式串联:

  1. 第一段的最后一帧导出
  2. 作为第二段的首帧输入
  3. 配合 Ref2VA 锁角色

就能做出连贯的多镜头。社区已经有人做出 30 秒三镜头、人物和声音全程一致的片子。


五、常见问题排查表

问题原因解决
报错找不到节点ComfyUI 版本太老 / 没装 GGUF升级 ComfyUI 0.27+,安装 ComfyUI-GGUF
加载模型爆显存崩溃量化版本太高换更低量化,启动参数加 --lowvram
生成出来没有声音音频 VAE 用了 fp16换回 fp32 版本
画面有了但音画不同步视频/音频 VAE 接反回到工作流检查 VAE 连线
速度慢到无法接受模型在机械硬盘 / 内存不足换 NVMe 固态;加大系统内存
画面崩坏、人物变形量化太狠(Q2/Q3)加显存或降分辨率换质量

六、资源清单

资源说明获取
ComfyUI 客户端免费开源,0.27+ 版本comfy.org
ComfyUI 整合包(备用)含全能版工作流及节点夸克网盘
MiniMax H3 模型文生/图生/视频转视频模型中心 / 网盘
全能版模型(BF16/量化)BF16 47.97G / 量化 24.55GHuggingFace / 夸克网盘 / 整合包
NVFP4 量化版8G 显存专用HuggingFace / 整合包
工作流节点ComfyUI-MiniMax-H3-GuideGitHub / 夸克网盘
工作流 JSON直接拖入 ComfyUI 界面夸克网盘 / 备用
示例提示词文生/图生各 1-2 条见上文”提示词进阶指南”
视频高清放大工具升 1080p/2K/4K夸克网盘 / 备用

💡 部分资源还有备用渠道(如 cloudeop 网盘),链接失效可留言获取。


结语

H3 这次开源的意义,不只在于”又多了一个能跑的模型”,而在于开源视频模型第一次在可控性上追平了闭源产品——音画同步生成、角色跨镜头一致、镜头语言可控、11 种语言口型,这些能力半年前还是闭源产品的护城河,现在权重就在你的硬盘里。

配置门槛确实还在:12G 显存是目前比较舒服的起点,8G 能跑但需要耐心。考虑到这才是开源第一周,量化方案和推理优化的迭代速度一向很快,一两个月后大概率会更友好。

想玩的朋友现在就动手吧。部署中遇到问题,欢迎评论区留言,我看到都会回。


内容整理自开源社区公开资料与实测经验,界面截图来源于公开教程。


下一篇
Claude Code 新功能:会话间通信完整指南