MiniMax H3 本地部署完整指南:從硬件配置到 ComfyUI 工作流實戰
MiniMax H3 是 MiniMax 推出的通用全模態生成模型,現已以開放權重形式提供。它能在單一上下文中聯合理解文本、圖像、視頻和音頻,並生成帶原生立體聲音頻的視頻——語音、音效和音樂在單次前向傳播中一併建模,而非事後疊加。
輸出最高支持 2K 分辨率、24fps,時長約 15 秒。更重要的是,H3 現已開源,你可以在本地完全控制每個參數。
本文將帶你從零開始,完成 MiniMax H3 的本地部署,涵蓋硬件配置、ComfyUI 安裝、模型下載、三種工作流實戰,以及性能優化技巧。
一、硬件配置要求:你的電腦能跑嗎?
MiniMax H3 對硬件要求不低,但已進入消費級高端顯卡的可觸及範圍。根據社區實測,以下是不同顯卡檔位的配置建議:
顯卡天梯圖
| 顯存 | 顯卡型號 | 量化方案 | 適用場景 |
|---|---|---|---|
| 24GB+(RTX 5090/4090) | 旗艦級 | FP16 / BF16 | 全質量生成,速度最快 |
| 16GB(RTX 4080 等) | 高端級 | Q5 / Q4 | 兼顧畫質與生成速度 |
| 12GB(RTX 3060/4070 Ti 等) | 主流級 | Q4 / pruned INT8 + NVFP4 | 推薦配置,實測可跑 |
| 8GB | 入門級 | 極限量化 | 勉強可跑,但體驗較差 |
最低配置建議
- 顯卡:NVIDIA RTX 3060 12GB(ComfyUI 官方確認的地板)
- 內存:32GB(必須,16GB 會爆內存)
- 系統:Windows 10/11 或 Linux
- ComfyUI 版本:0.30.0 或更高
推薦配置(流暢體驗)
- 顯卡:RTX 4080 16GB 或更高
- 內存:32GB DDR4/DDR5
- 硬盤:SSD(模型文件較大,機械硬盤加載慢)
💡 實測數據:RTX 4090 48GB(魔改版)可以流暢運行全精度模型;RTX 4080 16GB 使用量化版本可以兼顧畫質與速度;RTX 3060 12GB 配合 32GB 內存可以跑通,但生成時間較長。
二、安裝 ComfyUI
ComfyUI 是運行 MiniMax H3 的最佳平臺,官方已原生支持 H3 工作流。
2.1 下載 ComfyUI
方式一:官方安裝包(推薦新手)
訪問 ComfyUI 官網 下載對應系統的安裝包:
- Windows:
.exe安裝程序 - macOS:
.dmg安裝程序 - Linux:AppImage 或手動安裝
方式二:從 GitHub 源碼安裝(推薦進階用戶)
# 克隆仓库
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# 创建虚拟环境(推荐)
python -m venv venv
source venv/bin/activate # Linux/macOS
# venv\Scripts\activate # Windows
# 安装依赖
pip install -r requirements.txt
2.2 更新到 0.30.0+
MiniMax H3 需要 ComfyUI 0.30.0 或更高版本。如果你已有舊版本,請更新:
# 源码安装方式
git pull
pip install -r requirements.txt --upgrade
如果是官方安裝包,啓動時會自動檢查更新。
2.3 啓動 ComfyUI
# 源码安装方式
python main.py
# 或使用启动脚本
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh
啓動後訪問 http://127.0.0.1:8188 即可看到界面。
三、下載 MiniMax H3 模型文件
MiniMax H3 的模型文件託管在 Hugging Face 的 Comfy-Org/MiniMax-H3 倉庫。
3.1 模型文件清單
根據你使用的工作流類型,需要下載不同的模型文件:
文生視頻(T2V)和圖生視頻(I2V)工作流
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
參考生視頻(R2V)工作流
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # 注意:不同的扩散模型
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors # 共用
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors # 共用
│ └── minimax_h3_audio_vae_fp32.safetensors # 共用
3.2 下載方法
方式一:使用 Hugging Face CLI(推薦)
# 安装 huggingface_hub
pip install huggingface_hub
# 下载单个文件
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_fl2va_pruned_int8_convrot.safetensors \
--local-dir ./ComfyUI/models/diffusion_models/
# 下载文本编码器
huggingface-cli download Comfy-Org/MiniMax-H3 \
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
--local-dir ./ComfyUI/models/text_encoders/
# 下载 VAE
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_video_vae_fp16.safetensors \
--local-dir ./ComfyUI/models/vae/
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_audio_vae_fp32.safetensors \
--local-dir ./ComfyUI/models/vae/
方式二:瀏覽器手動下載
訪問 Hugging Face 倉庫,點擊文件右側的下載按鈕,手動下載到對應目錄。
方式三:使用 ComfyUI 自動下載
ComfyUI 0.30.0+ 支持自動下載缺失的模型文件。當你首次運行 MiniMax H3 工作流時,如果檢測到模型缺失,會彈出提示框引導你下載。
3.3 模型文件大小參考
- 擴散模型:約 10-15 GB(量化版本)
- 文本編碼器:約 20 GB(Qwen3-VL 32B)
- VAE:約 1-2 GB
💡 提示:如果網絡較慢,可以使用 Hugging Face 鏡像站或下載工具加速。
四、三種工作流實戰
ComfyUI 模板庫提供了三個 MiniMax H3 示例工作流,覆蓋三種生成模式。
4.1 文生視頻(T2V)
功能:根據文本提示詞生成帶原生立體聲音頻的視頻。
使用步驟:
- 打開 ComfyUI,點擊頂部菜單 工作流 → 瀏覽模板
- 在 視頻 分類中找到 MiniMax H3 T2V
- 點擊加載工作流
- 在 Prompt 節點中輸入你的提示詞
- 調整 Resolution Selector 節點設置輸出分辨率
- 點擊 Queue Prompt 開始生成
提示詞技巧:
- 描述整個場景:先描述整體場景(地點、人物、正在發生的事情),再按時間拆分爲多個鏡頭
- 鏡頭、相機和音頻:在同一個提示詞塊中描述鏡頭、相機運動以及伴隨的音頻(對話、音效、音樂)
- 分辨率:H3 的原生畫布短邊爲 768px,上限爲 768×1344 像素,取整到 32 的倍數
- 時長:時長輸入會對齊到模型在 24fps 下的每塊 17 幀網格
示例提示詞:
一个年轻女孩站在城市天台边缘,夕阳洒在她脸上。她转头看向镜头,微笑着说:"你好,世界。"
镜头缓慢推进,背景中城市灯光逐渐亮起。远处传来车流声和微风声。
4.2 圖生視頻(I2V)
功能:根據輸入圖像生成視頻,可選指定首幀/末幀關鍵幀。
使用步驟:
- 加載 MiniMax H3 I2V 工作流模板
- 在 Load Image 節點中上傳你的輸入圖像
- 可選:在 last_frame 輸入連接另一張圖像作爲末幀
- 輸入提示詞描述期望的運動和音頻
- 調整參數並生成
提示詞技巧:
- 關鍵幀:
first_frame和last_frame輸入爲可選;模型會生成它們之間的運動 - 提示詞:在同一個文本塊中描述鏡頭、動作以及伴隨的音頻
示例提示詞:
相机缓慢环绕产品旋转,展示其 360 度细节。背景保持纯白色,柔和的灯光从上方打下。
4.3 參考生視頻(R2V)
功能:從參考圖像、視頻和音頻的任意組合中生成視頻,鎖定角色、風格、動作、相機運鏡或聲音。
使用步驟:
- 加載 MiniMax H3 R2V 工作流模板
- 在 Picture 輸入節點上傳角色參考圖像(最多 9 張)
- 在 Video 輸入節點上傳風格/動作參考視頻(最多 3 個)
- 在 Audio 輸入節點上傳聲音參考音頻(最多 3 個)
- 輸入提示詞,按標籤引用每個輸入
提示詞技巧:
- 按標籤引用:按標籤引用每個輸入,順序須與其連接時完全一致,例如
<Picture 1>、<Video 1>、<Audio 1> - 爲每個參考分配任務:說明哪個參考負責畫面的哪個部分(身份、風格、動作、相機、聲音)
示例提示詞:
<Picture 1> 中的角色穿着红色斗篷,站在城市屋顶上。<Video 1> 中的相机运动被应用:
镜头从低角度仰拍,缓慢上升。角色的动作参考 <Video 2>:转身看向远方。
背景音效参考 <Audio 1>:风声和城市远处的交通声。
限制:
- 最多 9 張參考圖像
- 最多 3 個參考視頻(每個可攜帶自己的配樂)
- 最多 3 個獨立的參考音頻片段
ref_image_size:match會將參考縮小到生成分辨率以提高速度;max保留短邊最長 2048px,獲得更強的身份保真度
⚠️ 注意:R2V 使用
ref2va擴散模型,這是一組與 T2V 和 I2V 工作流所用fl2va模型不同的權重。確保下載正確的模型文件。
五、性能優化:使用 Sage Attention 加速生成
默認工作流使用標準注意力實現。使用 Sage Attention 可以將生成速度大約提升一倍,質量損失極小。
5.1 安裝 Sage Attention
- 訪問 SageAttention releases 頁面
- 下載與你 PyTorch 和 CUDA 版本匹配的 wheel 文件
- 安裝:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl
5.2 安裝 KJNodes 自定義節點
Sage Attention 需要通過 KJNodes 提供的節點使用:
方式一:使用 ComfyUI Manager(推薦)
在 ComfyUI 中打開 Manager,搜索 KJNodes 並安裝。
方式二:手動安裝
cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# 重启 ComfyUI
5.3 在工作流中使用
- 在工作流中添加 Patch Sage Attention KJ 節點
- 將其連接在 UNETLoader 和 BasicGuider 節點之間:
model輸入接收來自 UNETLoader 的模型model輸出連接到 BasicGuider 的model輸入
- 將
sage_attention設置爲auto - 照常運行工作流
全局啓用方式:
使用啓動參數啓動 ComfyUI:
python main.py --use-sage-attention
這樣無需在每個工作流中添加節點。
💡 提示:Sage Attention 要求 float16 或 bfloat16 張量。MiniMax H3 的部分層使用其他數據類型,因此你可能會在控制檯看到警告消息。這是正常現象;受影響的層會回退到標準注意力,生成仍然可以正常工作。
六、常見問題解答
Q1:爲什麼我的生成速度很慢?
可能原因:
- 顯存不足,使用了過度量化
- 內存不足(需要 32GB)
- 沒有啓用 Sage Attention
- 分辨率設置過高
解決方案:
- 降低分辨率(百萬像素設置爲 0.5-0.8)
- 啓用 Sage Attention
- 關閉其他佔用內存的程序
- 考慮升級顯卡
Q2:生成的視頻沒有聲音?
檢查清單:
- 確保下載了
minimax_h3_audio_vae_fp32.safetensors - 提示詞中描述了音頻內容(對話、音效、音樂)
- 工作流中音頻輸出節點連接正確
Q3:RTX 3060 12GB 能跑嗎?
可以,但需要注意:
- 使用量化版本(pruned INT8 + NVFP4)
- 內存必須 32GB
- 生成時間較長(可能 5-10 分鐘/視頻)
- 分辨率不要設置過高
Q4:如何提升視頻質量?
建議:
- 使用更高質量的量化方案(Q5 而非 Q4)
- 提高分辨率(百萬像素設置爲 1.0)
- 精心編寫提示詞,參考官方提示詞指南
- 使用參考生視頻(R2V)鎖定角色和風格
Q5:可以生成多長的視頻?
目前 MiniMax H3 單次生成時長約 15 秒(24fps)。如需更長視頻,可以:
- 生成多個片段後拼接
- 使用圖生視頻(I2V)的末幀作爲下一段的首幀,實現連續生成
七、進階資源
- ComfyUI 官方文檔:MiniMax H3 教程
- MiniMax H3 提示詞指南:官方文檔
- Hugging Face 模型倉庫:Comfy-Org/MiniMax-H3
- 社區工作流分享:GitHub - ComfyUI_MiniMaxH3_Director
八、總結
MiniMax H3 的開源爲視頻生成領域帶來了新的可能性。通過 ComfyUI,你可以在本地完全控制生成過程,從硬件配置到提示詞編寫,每個環節都可以精細調整。
關鍵要點回顧:
- 硬件要求:RTX 3060 12GB 是最低配置,RTX 4080 16GB 推薦
- 安裝步驟:ComfyUI 0.30.0+ → 下載模型文件 → 加載工作流
- 三種工作流:T2V(文生視頻)、I2V(圖生視頻)、R2V(參考生視頻)
- 性能優化:啓用 Sage Attention 可提速約一倍
- 提示詞技巧:描述場景、鏡頭、音頻,按標籤引用參考素材
現在,你已經掌握了 MiniMax H3 本地部署的完整流程。開始創作你的 AI 視頻吧!
📌 延伸閱讀: