MiniMax H3 本地部署完整指南:從硬件配置到 ComfyUI 工作流實戰

MiniMax H3 本地部署完整指南:從硬件配置到 ComfyUI 工作流實戰

MiniMax H3 本地部署完整指南:從硬件配置到 ComfyUI 工作流實戰

MiniMax H3 是 MiniMax 推出的通用全模態生成模型,現已以開放權重形式提供。它能在單一上下文中聯合理解文本、圖像、視頻和音頻,並生成帶原生立體聲音頻的視頻——語音、音效和音樂在單次前向傳播中一併建模,而非事後疊加。

輸出最高支持 2K 分辨率、24fps,時長約 15 秒。更重要的是,H3 現已開源,你可以在本地完全控制每個參數。

本文將帶你從零開始,完成 MiniMax H3 的本地部署,涵蓋硬件配置、ComfyUI 安裝、模型下載、三種工作流實戰,以及性能優化技巧。


一、硬件配置要求:你的電腦能跑嗎?

MiniMax H3 對硬件要求不低,但已進入消費級高端顯卡的可觸及範圍。根據社區實測,以下是不同顯卡檔位的配置建議:

顯卡天梯圖

顯存顯卡型號量化方案適用場景
24GB+(RTX 5090/4090)旗艦級FP16 / BF16全質量生成,速度最快
16GB(RTX 4080 等)高端級Q5 / Q4兼顧畫質與生成速度
12GB(RTX 3060/4070 Ti 等)主流級Q4 / pruned INT8 + NVFP4推薦配置,實測可跑
8GB入門級極限量化勉強可跑,但體驗較差

最低配置建議

  • 顯卡:NVIDIA RTX 3060 12GB(ComfyUI 官方確認的地板)
  • 內存:32GB(必須,16GB 會爆內存)
  • 系統:Windows 10/11 或 Linux
  • ComfyUI 版本:0.30.0 或更高

推薦配置(流暢體驗)

  • 顯卡:RTX 4080 16GB 或更高
  • 內存:32GB DDR4/DDR5
  • 硬盤:SSD(模型文件較大,機械硬盤加載慢)

💡 實測數據:RTX 4090 48GB(魔改版)可以流暢運行全精度模型;RTX 4080 16GB 使用量化版本可以兼顧畫質與速度;RTX 3060 12GB 配合 32GB 內存可以跑通,但生成時間較長。


二、安裝 ComfyUI

ComfyUI 是運行 MiniMax H3 的最佳平臺,官方已原生支持 H3 工作流。

2.1 下載 ComfyUI

方式一:官方安裝包(推薦新手)

訪問 ComfyUI 官網 下載對應系統的安裝包:

  • Windows:.exe 安裝程序
  • macOS:.dmg 安裝程序
  • Linux:AppImage 或手動安裝

方式二:從 GitHub 源碼安裝(推薦進階用戶)

# 克隆仓库
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI

# 创建虚拟环境(推荐)
python -m venv venv
source venv/bin/activate  # Linux/macOS
# venv\Scripts\activate   # Windows

# 安装依赖
pip install -r requirements.txt

2.2 更新到 0.30.0+

MiniMax H3 需要 ComfyUI 0.30.0 或更高版本。如果你已有舊版本,請更新:

# 源码安装方式
git pull
pip install -r requirements.txt --upgrade

如果是官方安裝包,啓動時會自動檢查更新。

2.3 啓動 ComfyUI

# 源码安装方式
python main.py

# 或使用启动脚本
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh

啓動後訪問 http://127.0.0.1:8188 即可看到界面。


三、下載 MiniMax H3 模型文件

MiniMax H3 的模型文件託管在 Hugging Face 的 Comfy-Org/MiniMax-H3 倉庫。

3.1 模型文件清單

根據你使用的工作流類型,需要下載不同的模型文件:

文生視頻(T2V)和圖生視頻(I2V)工作流

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

參考生視頻(R2V)工作流

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # 注意:不同的扩散模型
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors  # 共用
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors  # 共用
│       └── minimax_h3_audio_vae_fp32.safetensors  # 共用

3.2 下載方法

方式一:使用 Hugging Face CLI(推薦)

# 安装 huggingface_hub
pip install huggingface_hub

# 下载单个文件
huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  --local-dir ./ComfyUI/models/diffusion_models/

# 下载文本编码器
huggingface-cli download Comfy-Org/MiniMax-H3 \
  qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  --local-dir ./ComfyUI/models/text_encoders/

# 下载 VAE
huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_video_vae_fp16.safetensors \
  --local-dir ./ComfyUI/models/vae/

huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ./ComfyUI/models/vae/

方式二:瀏覽器手動下載

訪問 Hugging Face 倉庫,點擊文件右側的下載按鈕,手動下載到對應目錄。

方式三:使用 ComfyUI 自動下載

ComfyUI 0.30.0+ 支持自動下載缺失的模型文件。當你首次運行 MiniMax H3 工作流時,如果檢測到模型缺失,會彈出提示框引導你下載。

3.3 模型文件大小參考

  • 擴散模型:約 10-15 GB(量化版本)
  • 文本編碼器:約 20 GB(Qwen3-VL 32B)
  • VAE:約 1-2 GB

💡 提示:如果網絡較慢,可以使用 Hugging Face 鏡像站或下載工具加速。


四、三種工作流實戰

ComfyUI 模板庫提供了三個 MiniMax H3 示例工作流,覆蓋三種生成模式。

4.1 文生視頻(T2V)

功能:根據文本提示詞生成帶原生立體聲音頻的視頻。

使用步驟

  1. 打開 ComfyUI,點擊頂部菜單 工作流 → 瀏覽模板
  2. 視頻 分類中找到 MiniMax H3 T2V
  3. 點擊加載工作流
  4. Prompt 節點中輸入你的提示詞
  5. 調整 Resolution Selector 節點設置輸出分辨率
  6. 點擊 Queue Prompt 開始生成

提示詞技巧

  • 描述整個場景:先描述整體場景(地點、人物、正在發生的事情),再按時間拆分爲多個鏡頭
  • 鏡頭、相機和音頻:在同一個提示詞塊中描述鏡頭、相機運動以及伴隨的音頻(對話、音效、音樂)
  • 分辨率:H3 的原生畫布短邊爲 768px,上限爲 768×1344 像素,取整到 32 的倍數
  • 時長:時長輸入會對齊到模型在 24fps 下的每塊 17 幀網格

示例提示詞

一个年轻女孩站在城市天台边缘,夕阳洒在她脸上。她转头看向镜头,微笑着说:"你好,世界。" 
镜头缓慢推进,背景中城市灯光逐渐亮起。远处传来车流声和微风声。

4.2 圖生視頻(I2V)

功能:根據輸入圖像生成視頻,可選指定首幀/末幀關鍵幀。

使用步驟

  1. 加載 MiniMax H3 I2V 工作流模板
  2. Load Image 節點中上傳你的輸入圖像
  3. 可選:在 last_frame 輸入連接另一張圖像作爲末幀
  4. 輸入提示詞描述期望的運動和音頻
  5. 調整參數並生成

提示詞技巧

  • 關鍵幀first_framelast_frame 輸入爲可選;模型會生成它們之間的運動
  • 提示詞:在同一個文本塊中描述鏡頭、動作以及伴隨的音頻

示例提示詞

相机缓慢环绕产品旋转,展示其 360 度细节。背景保持纯白色,柔和的灯光从上方打下。

4.3 參考生視頻(R2V)

功能:從參考圖像、視頻和音頻的任意組合中生成視頻,鎖定角色、風格、動作、相機運鏡或聲音。

使用步驟

  1. 加載 MiniMax H3 R2V 工作流模板
  2. Picture 輸入節點上傳角色參考圖像(最多 9 張)
  3. Video 輸入節點上傳風格/動作參考視頻(最多 3 個)
  4. Audio 輸入節點上傳聲音參考音頻(最多 3 個)
  5. 輸入提示詞,按標籤引用每個輸入

提示詞技巧

  • 按標籤引用:按標籤引用每個輸入,順序須與其連接時完全一致,例如 <Picture 1><Video 1><Audio 1>
  • 爲每個參考分配任務:說明哪個參考負責畫面的哪個部分(身份、風格、動作、相機、聲音)

示例提示詞

<Picture 1> 中的角色穿着红色斗篷,站在城市屋顶上。<Video 1> 中的相机运动被应用: 
镜头从低角度仰拍,缓慢上升。角色的动作参考 <Video 2>:转身看向远方。
背景音效参考 <Audio 1>:风声和城市远处的交通声。

限制

  • 最多 9 張參考圖像
  • 最多 3 個參考視頻(每個可攜帶自己的配樂)
  • 最多 3 個獨立的參考音頻片段
  • ref_image_sizematch 會將參考縮小到生成分辨率以提高速度;max 保留短邊最長 2048px,獲得更強的身份保真度

⚠️ 注意:R2V 使用 ref2va 擴散模型,這是一組與 T2V 和 I2V 工作流所用 fl2va 模型不同的權重。確保下載正確的模型文件。


五、性能優化:使用 Sage Attention 加速生成

默認工作流使用標準注意力實現。使用 Sage Attention 可以將生成速度大約提升一倍,質量損失極小。

5.1 安裝 Sage Attention

  1. 訪問 SageAttention releases 頁面
  2. 下載與你 PyTorch 和 CUDA 版本匹配的 wheel 文件
  3. 安裝:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl

5.2 安裝 KJNodes 自定義節點

Sage Attention 需要通過 KJNodes 提供的節點使用:

方式一:使用 ComfyUI Manager(推薦)

在 ComfyUI 中打開 Manager,搜索 KJNodes 並安裝。

方式二:手動安裝

cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# 重启 ComfyUI

5.3 在工作流中使用

  1. 在工作流中添加 Patch Sage Attention KJ 節點
  2. 將其連接在 UNETLoaderBasicGuider 節點之間:
    • model 輸入接收來自 UNETLoader 的模型
    • model 輸出連接到 BasicGuider 的 model 輸入
  3. sage_attention 設置爲 auto
  4. 照常運行工作流

全局啓用方式

使用啓動參數啓動 ComfyUI:

python main.py --use-sage-attention

這樣無需在每個工作流中添加節點。

💡 提示:Sage Attention 要求 float16 或 bfloat16 張量。MiniMax H3 的部分層使用其他數據類型,因此你可能會在控制檯看到警告消息。這是正常現象;受影響的層會回退到標準注意力,生成仍然可以正常工作。


六、常見問題解答

Q1:爲什麼我的生成速度很慢?

可能原因

  • 顯存不足,使用了過度量化
  • 內存不足(需要 32GB)
  • 沒有啓用 Sage Attention
  • 分辨率設置過高

解決方案

  • 降低分辨率(百萬像素設置爲 0.5-0.8)
  • 啓用 Sage Attention
  • 關閉其他佔用內存的程序
  • 考慮升級顯卡

Q2:生成的視頻沒有聲音?

檢查清單

  • 確保下載了 minimax_h3_audio_vae_fp32.safetensors
  • 提示詞中描述了音頻內容(對話、音效、音樂)
  • 工作流中音頻輸出節點連接正確

Q3:RTX 3060 12GB 能跑嗎?

可以,但需要注意:

  • 使用量化版本(pruned INT8 + NVFP4)
  • 內存必須 32GB
  • 生成時間較長(可能 5-10 分鐘/視頻)
  • 分辨率不要設置過高

Q4:如何提升視頻質量?

建議

  • 使用更高質量的量化方案(Q5 而非 Q4)
  • 提高分辨率(百萬像素設置爲 1.0)
  • 精心編寫提示詞,參考官方提示詞指南
  • 使用參考生視頻(R2V)鎖定角色和風格

Q5:可以生成多長的視頻?

目前 MiniMax H3 單次生成時長約 15 秒(24fps)。如需更長視頻,可以:

  • 生成多個片段後拼接
  • 使用圖生視頻(I2V)的末幀作爲下一段的首幀,實現連續生成

七、進階資源


八、總結

MiniMax H3 的開源爲視頻生成領域帶來了新的可能性。通過 ComfyUI,你可以在本地完全控制生成過程,從硬件配置到提示詞編寫,每個環節都可以精細調整。

關鍵要點回顧

  1. 硬件要求:RTX 3060 12GB 是最低配置,RTX 4080 16GB 推薦
  2. 安裝步驟:ComfyUI 0.30.0+ → 下載模型文件 → 加載工作流
  3. 三種工作流:T2V(文生視頻)、I2V(圖生視頻)、R2V(參考生視頻)
  4. 性能優化:啓用 Sage Attention 可提速約一倍
  5. 提示詞技巧:描述場景、鏡頭、音頻,按標籤引用參考素材

現在,你已經掌握了 MiniMax H3 本地部署的完整流程。開始創作你的 AI 視頻吧!


📌 延伸閱讀