MiniMax H3 本地部署完整指南:从硬件配置到 ComfyUI 工作流实战
MiniMax H3 是 MiniMax 推出的通用全模态生成模型,现已以开放权重形式提供。它能在单一上下文中联合理解文本、图像、视频和音频,并生成带原生立体声音频的视频——语音、音效和音乐在单次前向传播中一并建模,而非事后叠加。
输出最高支持 2K 分辨率、24fps,时长约 15 秒。更重要的是,H3 现已开源,你可以在本地完全控制每个参数。
本文将带你从零开始,完成 MiniMax H3 的本地部署,涵盖硬件配置、ComfyUI 安装、模型下载、三种工作流实战,以及性能优化技巧。
一、硬件配置要求:你的电脑能跑吗?
MiniMax H3 对硬件要求不低,但已进入消费级高端显卡的可触及范围。根据社区实测,以下是不同显卡档位的配置建议:
显卡天梯图
| 显存 | 显卡型号 | 量化方案 | 适用场景 |
|---|---|---|---|
| 24GB+(RTX 5090/4090) | 旗舰级 | FP16 / BF16 | 全质量生成,速度最快 |
| 16GB(RTX 4080 等) | 高端级 | Q5 / Q4 | 兼顾画质与生成速度 |
| 12GB(RTX 3060/4070 Ti 等) | 主流级 | Q4 / pruned INT8 + NVFP4 | 推荐配置,实测可跑 |
| 8GB | 入门级 | 极限量化 | 勉强可跑,但体验较差 |
最低配置建议
- 显卡:NVIDIA RTX 3060 12GB(ComfyUI 官方确认的地板)
- 内存:32GB(必须,16GB 会爆内存)
- 系统:Windows 10/11 或 Linux
- ComfyUI 版本:0.30.0 或更高
推荐配置(流畅体验)
- 显卡:RTX 4080 16GB 或更高
- 内存:32GB DDR4/DDR5
- 硬盘:SSD(模型文件较大,机械硬盘加载慢)
💡 实测数据:RTX 4090 48GB(魔改版)可以流畅运行全精度模型;RTX 4080 16GB 使用量化版本可以兼顾画质与速度;RTX 3060 12GB 配合 32GB 内存可以跑通,但生成时间较长。
二、安装 ComfyUI
ComfyUI 是运行 MiniMax H3 的最佳平台,官方已原生支持 H3 工作流。
2.1 下载 ComfyUI
方式一:官方安装包(推荐新手)
访问 ComfyUI 官网 下载对应系统的安装包:
- Windows:
.exe安装程序 - macOS:
.dmg安装程序 - Linux:AppImage 或手动安装
方式二:从 GitHub 源码安装(推荐进阶用户)
# 克隆仓库
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# 创建虚拟环境(推荐)
python -m venv venv
source venv/bin/activate # Linux/macOS
# venv\Scripts\activate # Windows
# 安装依赖
pip install -r requirements.txt
2.2 更新到 0.30.0+
MiniMax H3 需要 ComfyUI 0.30.0 或更高版本。如果你已有旧版本,请更新:
# 源码安装方式
git pull
pip install -r requirements.txt --upgrade
如果是官方安装包,启动时会自动检查更新。
2.3 启动 ComfyUI
# 源码安装方式
python main.py
# 或使用启动脚本
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh
启动后访问 http://127.0.0.1:8188 即可看到界面。
三、下载 MiniMax H3 模型文件
MiniMax H3 的模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库。
3.1 模型文件清单
根据你使用的工作流类型,需要下载不同的模型文件:
文生视频(T2V)和图生视频(I2V)工作流
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
参考生视频(R2V)工作流
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # 注意:不同的扩散模型
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors # 共用
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors # 共用
│ └── minimax_h3_audio_vae_fp32.safetensors # 共用
3.2 下载方法
方式一:使用 Hugging Face CLI(推荐)
# 安装 huggingface_hub
pip install huggingface_hub
# 下载单个文件
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_fl2va_pruned_int8_convrot.safetensors \
--local-dir ./ComfyUI/models/diffusion_models/
# 下载文本编码器
huggingface-cli download Comfy-Org/MiniMax-H3 \
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
--local-dir ./ComfyUI/models/text_encoders/
# 下载 VAE
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_video_vae_fp16.safetensors \
--local-dir ./ComfyUI/models/vae/
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_audio_vae_fp32.safetensors \
--local-dir ./ComfyUI/models/vae/
方式二:浏览器手动下载
访问 Hugging Face 仓库,点击文件右侧的下载按钮,手动下载到对应目录。
方式三:使用 ComfyUI 自动下载
ComfyUI 0.30.0+ 支持自动下载缺失的模型文件。当你首次运行 MiniMax H3 工作流时,如果检测到模型缺失,会弹出提示框引导你下载。
3.3 模型文件大小参考
- 扩散模型:约 10-15 GB(量化版本)
- 文本编码器:约 20 GB(Qwen3-VL 32B)
- VAE:约 1-2 GB
💡 提示:如果网络较慢,可以使用 Hugging Face 镜像站或下载工具加速。
四、三种工作流实战
ComfyUI 模板库提供了三个 MiniMax H3 示例工作流,覆盖三种生成模式。
4.1 文生视频(T2V)
功能:根据文本提示词生成带原生立体声音频的视频。
使用步骤:
- 打开 ComfyUI,点击顶部菜单 工作流 → 浏览模板
- 在 视频 分类中找到 MiniMax H3 T2V
- 点击加载工作流
- 在 Prompt 节点中输入你的提示词
- 调整 Resolution Selector 节点设置输出分辨率
- 点击 Queue Prompt 开始生成
提示词技巧:
- 描述整个场景:先描述整体场景(地点、人物、正在发生的事情),再按时间拆分为多个镜头
- 镜头、相机和音频:在同一个提示词块中描述镜头、相机运动以及伴随的音频(对话、音效、音乐)
- 分辨率:H3 的原生画布短边为 768px,上限为 768×1344 像素,取整到 32 的倍数
- 时长:时长输入会对齐到模型在 24fps 下的每块 17 帧网格
示例提示词:
一个年轻女孩站在城市天台边缘,夕阳洒在她脸上。她转头看向镜头,微笑着说:"你好,世界。"
镜头缓慢推进,背景中城市灯光逐渐亮起。远处传来车流声和微风声。
4.2 图生视频(I2V)
功能:根据输入图像生成视频,可选指定首帧/末帧关键帧。
使用步骤:
- 加载 MiniMax H3 I2V 工作流模板
- 在 Load Image 节点中上传你的输入图像
- 可选:在 last_frame 输入连接另一张图像作为末帧
- 输入提示词描述期望的运动和音频
- 调整参数并生成
提示词技巧:
- 关键帧:
first_frame和last_frame输入为可选;模型会生成它们之间的运动 - 提示词:在同一个文本块中描述镜头、动作以及伴随的音频
示例提示词:
相机缓慢环绕产品旋转,展示其 360 度细节。背景保持纯白色,柔和的灯光从上方打下。
4.3 参考生视频(R2V)
功能:从参考图像、视频和音频的任意组合中生成视频,锁定角色、风格、动作、相机运镜或声音。
使用步骤:
- 加载 MiniMax H3 R2V 工作流模板
- 在 Picture 输入节点上传角色参考图像(最多 9 张)
- 在 Video 输入节点上传风格/动作参考视频(最多 3 个)
- 在 Audio 输入节点上传声音参考音频(最多 3 个)
- 输入提示词,按标签引用每个输入
提示词技巧:
- 按标签引用:按标签引用每个输入,顺序须与其连接时完全一致,例如
<Picture 1>、<Video 1>、<Audio 1> - 为每个参考分配任务:说明哪个参考负责画面的哪个部分(身份、风格、动作、相机、声音)
示例提示词:
<Picture 1> 中的角色穿着红色斗篷,站在城市屋顶上。<Video 1> 中的相机运动被应用:
镜头从低角度仰拍,缓慢上升。角色的动作参考 <Video 2>:转身看向远方。
背景音效参考 <Audio 1>:风声和城市远处的交通声。
限制:
- 最多 9 张参考图像
- 最多 3 个参考视频(每个可携带自己的配乐)
- 最多 3 个独立的参考音频片段
ref_image_size:match会将参考缩小到生成分辨率以提高速度;max保留短边最长 2048px,获得更强的身份保真度
⚠️ 注意:R2V 使用
ref2va扩散模型,这是一组与 T2V 和 I2V 工作流所用fl2va模型不同的权重。确保下载正确的模型文件。
五、性能优化:使用 Sage Attention 加速生成
默认工作流使用标准注意力实现。使用 Sage Attention 可以将生成速度大约提升一倍,质量损失极小。
5.1 安装 Sage Attention
- 访问 SageAttention releases 页面
- 下载与你 PyTorch 和 CUDA 版本匹配的 wheel 文件
- 安装:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl
5.2 安装 KJNodes 自定义节点
Sage Attention 需要通过 KJNodes 提供的节点使用:
方式一:使用 ComfyUI Manager(推荐)
在 ComfyUI 中打开 Manager,搜索 KJNodes 并安装。
方式二:手动安装
cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# 重启 ComfyUI
5.3 在工作流中使用
- 在工作流中添加 Patch Sage Attention KJ 节点
- 将其连接在 UNETLoader 和 BasicGuider 节点之间:
model输入接收来自 UNETLoader 的模型model输出连接到 BasicGuider 的model输入
- 将
sage_attention设置为auto - 照常运行工作流
全局启用方式:
使用启动参数启动 ComfyUI:
python main.py --use-sage-attention
这样无需在每个工作流中添加节点。
💡 提示:Sage Attention 要求 float16 或 bfloat16 张量。MiniMax H3 的部分层使用其他数据类型,因此你可能会在控制台看到警告消息。这是正常现象;受影响的层会回退到标准注意力,生成仍然可以正常工作。
六、常见问题解答
Q1:为什么我的生成速度很慢?
可能原因:
- 显存不足,使用了过度量化
- 内存不足(需要 32GB)
- 没有启用 Sage Attention
- 分辨率设置过高
解决方案:
- 降低分辨率(百万像素设置为 0.5-0.8)
- 启用 Sage Attention
- 关闭其他占用内存的程序
- 考虑升级显卡
Q2:生成的视频没有声音?
检查清单:
- 确保下载了
minimax_h3_audio_vae_fp32.safetensors - 提示词中描述了音频内容(对话、音效、音乐)
- 工作流中音频输出节点连接正确
Q3:RTX 3060 12GB 能跑吗?
可以,但需要注意:
- 使用量化版本(pruned INT8 + NVFP4)
- 内存必须 32GB
- 生成时间较长(可能 5-10 分钟/视频)
- 分辨率不要设置过高
Q4:如何提升视频质量?
建议:
- 使用更高质量的量化方案(Q5 而非 Q4)
- 提高分辨率(百万像素设置为 1.0)
- 精心编写提示词,参考官方提示词指南
- 使用参考生视频(R2V)锁定角色和风格
Q5:可以生成多长的视频?
目前 MiniMax H3 单次生成时长约 15 秒(24fps)。如需更长视频,可以:
- 生成多个片段后拼接
- 使用图生视频(I2V)的末帧作为下一段的首帧,实现连续生成
七、进阶资源
- ComfyUI 官方文档:MiniMax H3 教程
- MiniMax H3 提示词指南:官方文档
- Hugging Face 模型仓库:Comfy-Org/MiniMax-H3
- 社区工作流分享:GitHub - ComfyUI_MiniMaxH3_Director
八、总结
MiniMax H3 的开源为视频生成领域带来了新的可能性。通过 ComfyUI,你可以在本地完全控制生成过程,从硬件配置到提示词编写,每个环节都可以精细调整。
关键要点回顾:
- 硬件要求:RTX 3060 12GB 是最低配置,RTX 4080 16GB 推荐
- 安装步骤:ComfyUI 0.30.0+ → 下载模型文件 → 加载工作流
- 三种工作流:T2V(文生视频)、I2V(图生视频)、R2V(参考生视频)
- 性能优化:启用 Sage Attention 可提速约一倍
- 提示词技巧:描述场景、镜头、音频,按标签引用参考素材
现在,你已经掌握了 MiniMax H3 本地部署的完整流程。开始创作你的 AI 视频吧!
📌 延伸阅读: