MiniMax H3 本地部署完整指南:从硬件配置到 ComfyUI 工作流实战

MiniMax H3 本地部署完整指南:从硬件配置到 ComfyUI 工作流实战

MiniMax H3 本地部署完整指南:从硬件配置到 ComfyUI 工作流实战

MiniMax H3 是 MiniMax 推出的通用全模态生成模型,现已以开放权重形式提供。它能在单一上下文中联合理解文本、图像、视频和音频,并生成带原生立体声音频的视频——语音、音效和音乐在单次前向传播中一并建模,而非事后叠加。

输出最高支持 2K 分辨率、24fps,时长约 15 秒。更重要的是,H3 现已开源,你可以在本地完全控制每个参数。

本文将带你从零开始,完成 MiniMax H3 的本地部署,涵盖硬件配置、ComfyUI 安装、模型下载、三种工作流实战,以及性能优化技巧。


一、硬件配置要求:你的电脑能跑吗?

MiniMax H3 对硬件要求不低,但已进入消费级高端显卡的可触及范围。根据社区实测,以下是不同显卡档位的配置建议:

显卡天梯图

显存显卡型号量化方案适用场景
24GB+(RTX 5090/4090)旗舰级FP16 / BF16全质量生成,速度最快
16GB(RTX 4080 等)高端级Q5 / Q4兼顾画质与生成速度
12GB(RTX 3060/4070 Ti 等)主流级Q4 / pruned INT8 + NVFP4推荐配置,实测可跑
8GB入门级极限量化勉强可跑,但体验较差

最低配置建议

  • 显卡:NVIDIA RTX 3060 12GB(ComfyUI 官方确认的地板)
  • 内存:32GB(必须,16GB 会爆内存)
  • 系统:Windows 10/11 或 Linux
  • ComfyUI 版本:0.30.0 或更高

推荐配置(流畅体验)

  • 显卡:RTX 4080 16GB 或更高
  • 内存:32GB DDR4/DDR5
  • 硬盘:SSD(模型文件较大,机械硬盘加载慢)

💡 实测数据:RTX 4090 48GB(魔改版)可以流畅运行全精度模型;RTX 4080 16GB 使用量化版本可以兼顾画质与速度;RTX 3060 12GB 配合 32GB 内存可以跑通,但生成时间较长。


二、安装 ComfyUI

ComfyUI 是运行 MiniMax H3 的最佳平台,官方已原生支持 H3 工作流。

2.1 下载 ComfyUI

方式一:官方安装包(推荐新手)

访问 ComfyUI 官网 下载对应系统的安装包:

  • Windows:.exe 安装程序
  • macOS:.dmg 安装程序
  • Linux:AppImage 或手动安装

方式二:从 GitHub 源码安装(推荐进阶用户)

# 克隆仓库
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI

# 创建虚拟环境(推荐)
python -m venv venv
source venv/bin/activate  # Linux/macOS
# venv\Scripts\activate   # Windows

# 安装依赖
pip install -r requirements.txt

2.2 更新到 0.30.0+

MiniMax H3 需要 ComfyUI 0.30.0 或更高版本。如果你已有旧版本,请更新:

# 源码安装方式
git pull
pip install -r requirements.txt --upgrade

如果是官方安装包,启动时会自动检查更新。

2.3 启动 ComfyUI

# 源码安装方式
python main.py

# 或使用启动脚本
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh

启动后访问 http://127.0.0.1:8188 即可看到界面。


三、下载 MiniMax H3 模型文件

MiniMax H3 的模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库。

3.1 模型文件清单

根据你使用的工作流类型,需要下载不同的模型文件:

文生视频(T2V)和图生视频(I2V)工作流

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

参考生视频(R2V)工作流

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # 注意:不同的扩散模型
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors  # 共用
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors  # 共用
│       └── minimax_h3_audio_vae_fp32.safetensors  # 共用

3.2 下载方法

方式一:使用 Hugging Face CLI(推荐)

# 安装 huggingface_hub
pip install huggingface_hub

# 下载单个文件
huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  --local-dir ./ComfyUI/models/diffusion_models/

# 下载文本编码器
huggingface-cli download Comfy-Org/MiniMax-H3 \
  qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  --local-dir ./ComfyUI/models/text_encoders/

# 下载 VAE
huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_video_vae_fp16.safetensors \
  --local-dir ./ComfyUI/models/vae/

huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ./ComfyUI/models/vae/

方式二:浏览器手动下载

访问 Hugging Face 仓库,点击文件右侧的下载按钮,手动下载到对应目录。

方式三:使用 ComfyUI 自动下载

ComfyUI 0.30.0+ 支持自动下载缺失的模型文件。当你首次运行 MiniMax H3 工作流时,如果检测到模型缺失,会弹出提示框引导你下载。

3.3 模型文件大小参考

  • 扩散模型:约 10-15 GB(量化版本)
  • 文本编码器:约 20 GB(Qwen3-VL 32B)
  • VAE:约 1-2 GB

💡 提示:如果网络较慢,可以使用 Hugging Face 镜像站或下载工具加速。


四、三种工作流实战

ComfyUI 模板库提供了三个 MiniMax H3 示例工作流,覆盖三种生成模式。

4.1 文生视频(T2V)

功能:根据文本提示词生成带原生立体声音频的视频。

使用步骤

  1. 打开 ComfyUI,点击顶部菜单 工作流 → 浏览模板
  2. 视频 分类中找到 MiniMax H3 T2V
  3. 点击加载工作流
  4. Prompt 节点中输入你的提示词
  5. 调整 Resolution Selector 节点设置输出分辨率
  6. 点击 Queue Prompt 开始生成

提示词技巧

  • 描述整个场景:先描述整体场景(地点、人物、正在发生的事情),再按时间拆分为多个镜头
  • 镜头、相机和音频:在同一个提示词块中描述镜头、相机运动以及伴随的音频(对话、音效、音乐)
  • 分辨率:H3 的原生画布短边为 768px,上限为 768×1344 像素,取整到 32 的倍数
  • 时长:时长输入会对齐到模型在 24fps 下的每块 17 帧网格

示例提示词

一个年轻女孩站在城市天台边缘,夕阳洒在她脸上。她转头看向镜头,微笑着说:"你好,世界。" 
镜头缓慢推进,背景中城市灯光逐渐亮起。远处传来车流声和微风声。

4.2 图生视频(I2V)

功能:根据输入图像生成视频,可选指定首帧/末帧关键帧。

使用步骤

  1. 加载 MiniMax H3 I2V 工作流模板
  2. Load Image 节点中上传你的输入图像
  3. 可选:在 last_frame 输入连接另一张图像作为末帧
  4. 输入提示词描述期望的运动和音频
  5. 调整参数并生成

提示词技巧

  • 关键帧first_framelast_frame 输入为可选;模型会生成它们之间的运动
  • 提示词:在同一个文本块中描述镜头、动作以及伴随的音频

示例提示词

相机缓慢环绕产品旋转,展示其 360 度细节。背景保持纯白色,柔和的灯光从上方打下。

4.3 参考生视频(R2V)

功能:从参考图像、视频和音频的任意组合中生成视频,锁定角色、风格、动作、相机运镜或声音。

使用步骤

  1. 加载 MiniMax H3 R2V 工作流模板
  2. Picture 输入节点上传角色参考图像(最多 9 张)
  3. Video 输入节点上传风格/动作参考视频(最多 3 个)
  4. Audio 输入节点上传声音参考音频(最多 3 个)
  5. 输入提示词,按标签引用每个输入

提示词技巧

  • 按标签引用:按标签引用每个输入,顺序须与其连接时完全一致,例如 <Picture 1><Video 1><Audio 1>
  • 为每个参考分配任务:说明哪个参考负责画面的哪个部分(身份、风格、动作、相机、声音)

示例提示词

<Picture 1> 中的角色穿着红色斗篷,站在城市屋顶上。<Video 1> 中的相机运动被应用: 
镜头从低角度仰拍,缓慢上升。角色的动作参考 <Video 2>:转身看向远方。
背景音效参考 <Audio 1>:风声和城市远处的交通声。

限制

  • 最多 9 张参考图像
  • 最多 3 个参考视频(每个可携带自己的配乐)
  • 最多 3 个独立的参考音频片段
  • ref_image_sizematch 会将参考缩小到生成分辨率以提高速度;max 保留短边最长 2048px,获得更强的身份保真度

⚠️ 注意:R2V 使用 ref2va 扩散模型,这是一组与 T2V 和 I2V 工作流所用 fl2va 模型不同的权重。确保下载正确的模型文件。


五、性能优化:使用 Sage Attention 加速生成

默认工作流使用标准注意力实现。使用 Sage Attention 可以将生成速度大约提升一倍,质量损失极小。

5.1 安装 Sage Attention

  1. 访问 SageAttention releases 页面
  2. 下载与你 PyTorch 和 CUDA 版本匹配的 wheel 文件
  3. 安装:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl

5.2 安装 KJNodes 自定义节点

Sage Attention 需要通过 KJNodes 提供的节点使用:

方式一:使用 ComfyUI Manager(推荐)

在 ComfyUI 中打开 Manager,搜索 KJNodes 并安装。

方式二:手动安装

cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# 重启 ComfyUI

5.3 在工作流中使用

  1. 在工作流中添加 Patch Sage Attention KJ 节点
  2. 将其连接在 UNETLoaderBasicGuider 节点之间:
    • model 输入接收来自 UNETLoader 的模型
    • model 输出连接到 BasicGuider 的 model 输入
  3. sage_attention 设置为 auto
  4. 照常运行工作流

全局启用方式

使用启动参数启动 ComfyUI:

python main.py --use-sage-attention

这样无需在每个工作流中添加节点。

💡 提示:Sage Attention 要求 float16 或 bfloat16 张量。MiniMax H3 的部分层使用其他数据类型,因此你可能会在控制台看到警告消息。这是正常现象;受影响的层会回退到标准注意力,生成仍然可以正常工作。


六、常见问题解答

Q1:为什么我的生成速度很慢?

可能原因

  • 显存不足,使用了过度量化
  • 内存不足(需要 32GB)
  • 没有启用 Sage Attention
  • 分辨率设置过高

解决方案

  • 降低分辨率(百万像素设置为 0.5-0.8)
  • 启用 Sage Attention
  • 关闭其他占用内存的程序
  • 考虑升级显卡

Q2:生成的视频没有声音?

检查清单

  • 确保下载了 minimax_h3_audio_vae_fp32.safetensors
  • 提示词中描述了音频内容(对话、音效、音乐)
  • 工作流中音频输出节点连接正确

Q3:RTX 3060 12GB 能跑吗?

可以,但需要注意:

  • 使用量化版本(pruned INT8 + NVFP4)
  • 内存必须 32GB
  • 生成时间较长(可能 5-10 分钟/视频)
  • 分辨率不要设置过高

Q4:如何提升视频质量?

建议

  • 使用更高质量的量化方案(Q5 而非 Q4)
  • 提高分辨率(百万像素设置为 1.0)
  • 精心编写提示词,参考官方提示词指南
  • 使用参考生视频(R2V)锁定角色和风格

Q5:可以生成多长的视频?

目前 MiniMax H3 单次生成时长约 15 秒(24fps)。如需更长视频,可以:

  • 生成多个片段后拼接
  • 使用图生视频(I2V)的末帧作为下一段的首帧,实现连续生成

七、进阶资源


八、总结

MiniMax H3 的开源为视频生成领域带来了新的可能性。通过 ComfyUI,你可以在本地完全控制生成过程,从硬件配置到提示词编写,每个环节都可以精细调整。

关键要点回顾

  1. 硬件要求:RTX 3060 12GB 是最低配置,RTX 4080 16GB 推荐
  2. 安装步骤:ComfyUI 0.30.0+ → 下载模型文件 → 加载工作流
  3. 三种工作流:T2V(文生视频)、I2V(图生视频)、R2V(参考生视频)
  4. 性能优化:启用 Sage Attention 可提速约一倍
  5. 提示词技巧:描述场景、镜头、音频,按标签引用参考素材

现在,你已经掌握了 MiniMax H3 本地部署的完整流程。开始创作你的 AI 视频吧!


📌 延伸阅读