MiniMax H3 ローカルデプロイ完全ガイド:ハードウェア構成から ComfyUI ワークフロー実践まで
MiniMax H3 は MiniMax が展開する汎用全モーダル生成モデルで、現在オープンウェイトとして提供されています。テキスト、画像、動画、音声を単一のコンテキストで統合的に理解し、ネイティブステレオ音声付きの動画を生成できます——音声、効果音、音楽が単一のフォワードパスで同時にモデル化され、後付けではありません。
出力は最大 2K 解像度、24fps、約 15秒の長さをサポートします。さらに重要なのは、H3 がオープンソース化され、ローカルで全てのパラメータを完全に制御できるようになったことです。
本記事では、MiniMax H3 のローカルデプロイをゼロからご案内します。ハードウェア構成、ComfyUI インストール、モデルダウンロード、3種類のワークフロー実践、パフォーマンス最適化テクニックまで網羅しています。
一、ハードウェア構成要件:あなたのPCで動作するか?
MiniMax H3 はハードウェア要件が低くありませんが、コンシューマー向けハイエンドGPUの手の届く範囲に入っています。コミュニティの実測に基づく、GPUクラス別の構成推奨を以下に示します。
GPUティア一覧
| VRAM | GPU型番 | 量子化方式 | 用途 |
|---|---|---|---|
| 24GB以上(RTX 5090/4090) | フラッグシップ | FP16 / BF16 | フル品質生成、最速 |
| 16GB(RTX 4080等) | ハイエンド | Q5 / Q4 | 画質と生成速度のバランス |
| 12GB(RTX 3060/4070 Ti等) | メインストリーム | Q4 / pruned INT8 + NVFP4 | 推奨構成、実測動作確認済み |
| 8GB | エントリー | 限界量子化 | 動作はするが体験は劣る |
最低構成推奨
- GPU:NVIDIA RTX 3060 12GB(ComfyUI 公式確認の最低ライン)
- メモリ:32GB(必須、16GBではメモリ不足になります)
- OS:Windows 10/11 または Linux
- ComfyUI バージョン:0.30.0 以上
推奨構成(快適な動作環境)
- GPU:RTX 4080 16GB 以上
- メモリ:32GB DDR4/DDR5
- ストレージ:SSD(モデルファイルが大きいため、HDDでは読み込みが遅い)
💡 実測データ:RTX 4090 48GB(改造版)ではフル精度モデルが快適に動作します。RTX 4080 16GB では量子化版で画質と速度を両立できます。RTX 3060 12GB に32GBメモリを組み合わせると動作しますが、生成時間は長くなります。
二、ComfyUI のインストール
ComfyUI は MiniMax H3 を実行するための最適なプラットフォームで、公式に H3 ワークフローをネイティブサポートしています。
2.1 ComfyUI のダウンロード
方法1:公式インストーラー(初心者向け推奨)
ComfyUI 公式サイト から各OS用のインストーラーをダウンロードしてください:
- Windows:
.exeインストーラー - macOS:
.dmgインストーラー - Linux:AppImage または手動インストール
方法2:GitHub ソースコードからのインストール(上級者向け推奨)
# リポジトリをクローン
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# 仮想環境を作成(推奨)
python -m venv venv
source venv/bin/activate # Linux/macOS
# venv\Scripts\activate # Windows
# 依存パッケージをインストール
pip install -r requirements.txt
2.2 バージョン 0.30.0+ への更新
MiniMax H3 には ComfyUI 0.30.0 以上が必要です。旧バージョンをお持ちの場合は更新してください:
# ソースコードインストールの場合
git pull
pip install -r requirements.txt --upgrade
公式インストーラーの場合は、起動時に自動でアップデートをチェックします。
2.3 ComfyUI の起動
# ソースコードインストールの場合
python main.py
# または起動スクリプトを使用
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh
起動後、http://127.0.0.1:8188 にアクセスするとインターフェースが表示されます。
三、MiniMax H3 モデルファイルのダウンロード
MiniMax H3 のモデルファイルは Hugging Face の Comfy-Org/MiniMax-H3 リポジトリでホストされています。
3.1 モデルファイル一覧
使用するワークフローの種類に応じて、異なるモデルファイルが必要です:
テキストから動画(T2V)および画像から動画(I2V)ワークフロー
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
参照から動画(R2V)ワークフロー
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # 注意:異なる拡散モデル
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors # 共通
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors # 共通
│ └── minimax_h3_audio_vae_fp32.safetensors # 共通
3.2 ダウンロード方法
方法1:Hugging Face CLI を使用(推奨)
# huggingface_hub をインストール
pip install huggingface_hub
# 個別ファイルをダウンロード
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_fl2va_pruned_int8_convrot.safetensors \
--local-dir ./ComfyUI/models/diffusion_models/
# テキストエンコーダーをダウンロード
huggingface-cli download Comfy-Org/MiniMax-H3 \
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
--local-dir ./ComfyUI/models/text_encoders/
# VAE をダウンロード
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_video_vae_fp16.safetensors \
--local-dir ./ComfyUI/models/vae/
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_audio_vae_fp32.safetensors \
--local-dir ./ComfyUI/models/vae/
方法2:ブラウザから手動ダウンロード
Hugging Face リポジトリ にアクセスし、ファイル横のダウンロードボタンをクリックして、各ディレクトリに手動でダウンロードしてください。
方法3:ComfyUI の自動ダウンロードを使用
ComfyUI 0.30.0+ は不足モデルファイルの自動ダウンロードに対応しています。MiniMax H3 ワークフローを初めて実行する際、モデルが不足している場合、ダウンロードを案内するダイアログが表示されます。
3.3 モデルファイルサイズの目安
- 拡散モデル:約 10〜15 GB(量子化バージョン)
- テキストエンコーダー:約 20 GB(Qwen3-VL 32B)
- VAE:約 1〜2 GB
💡 ヒント:ネットワークが遅い場合は、Hugging Face ミラーサイトやダウンロードツールで高速化できます。
四、3種類のワークフロー実践
ComfyUI テンプレートライブラリには、3つの MiniMax H3 サンプルワークフローが用意されており、3つの生成モードをカバーしています。
4.1 テキストから動画(T2V)
機能:テキストプロンプトからネイティブステレオ音声付きの動画を生成します。
使用手順:
- ComfyUI を開き、上部メニューの ワークフロー → テンプレートブラウズ をクリック
- 動画 カテゴリから MiniMax H3 T2V を探す
- ワークフローを読み込む
- Prompt ノードにプロンプトを入力
- Resolution Selector ノードで出力解像度を調整
- Queue Prompt をクリックして生成開始
プロンプトテクニック:
- シーン全体の記述:まず全体像(場所、人物、起きていること)を記述し、その後時系列で複数のショットに分割する
- カメラと音声:同じプロンプトブロック内で、カメラワークと付随する音声(セリフ、効果音、音楽)を記述する
- 解像度:H3 のネイティブキャンバスの短辺は 768px、上限は 768×1344 ピクセル、32の倍数に丸める
- 長さ:長さ入力は 24fps での17フレーム単位のグリッドにアライメントされる
プロンプト例:
若い女の子が都市の屋上の端に立ち、夕日が彼女の顔に降り注いでいる。
彼女はカメラの方を向き、微笑んで「こんにちは、世界」と言う。
カメラがゆっくりとズームインし、背景の街の灯りが徐々に灯っていく。
遠くから車の音とそよ風が聞こえる。
4.2 画像から動画(I2V)
機能:入力画像から動画を生成します。オプションで先頭フレーム/最終フレームのキーフレームを指定できます。
使用手順:
- MiniMax H3 I2V ワークフローテンプレートを読み込む
- Load Image ノードで入力画像をアップロード
- オプション:last_frame 入力に別の画像を最終フレームとして接続
- 期待する動きと音声を記述したプロンプトを入力
- パラメータを調整して生成
プロンプトテクニック:
- キーフレーム:
first_frameとlast_frame入力はオプションです。モデルはその間の動きを生成します - プロンプト:同じテキストブロックでカメラワーク、アクション、付随する音声を記述する
プロンプト例:
カメラが製品をゆっくりと360度回転し、細部を映し出す。
背景は純白を保ち、柔らかい照明が上から降り注ぐ。
4.3 参照から動画(R2V)
機能:参照画像、動画、音声の任意の組み合わせから動画を生成し、キャラクター、スタイル、アクション、カメラワーク、または音声を固定します。
使用手順:
- MiniMax H3 R2V ワークフローテンプレートを読み込む
- Picture 入力ノードにキャラクター参照画像をアップロード(最大9枚)
- Video 入力ノードにスタイル/アクション参照動画をアップロード(最大3つ)
- Audio 入力ノードに音声参照オーディオをアップロード(最大3つ)
- 各入力をタグで参照するプロンプトを入力
プロンプトテクニック:
- タグで参照:各入力をタグで参照します。順序は接続時と完全に一致する必要があります。例:
<Picture 1>、<Video 1>、<Audio 1> - 各参照に役割を割り当てる:どの参照が画像のどの部分(アイデンティティ、スタイル、アクション、カメラ、音声)を担当するかを明示する
プロンプト例:
<Picture 1> のキャラクターは赤いマントを着て、都市の屋上に立っている。
<Video 1> のカメラワークを適用:ローアングルからゆっくりと上昇する。
キャラクターのアクションは <Video 2> を参照:振り返って遠くを見る。
背景の音響効果は <Audio 1> を参照:風の声と遠くの都市の交通音。
制限事項:
- 参照画像は最大9枚
- 参照動画は最大3つ(各動画に独自のサウンドトラックを付加可能)
- 独立した参照オーディオクリップは最大3つ
ref_image_size:matchは参照を生成分解能に縮小して速度を向上。maxは短辺最長2048pxを保持し、アイデンティティの忠実度を向上
⚠️ 注意:R2V は
ref2va拡散モデルを使用します。これは T2V と I2V ワークフローで使用されるfl2vaモデルとは異なるウェイトです。正しいモデルファイルをダウンロードしてください。
五、パフォーマンス最適化:Sage Attention による生成高速化
デフォルトのワークフローは標準的なアテンション実装を使用します。Sage Attention を使用すると、品質の劣化を最小限に抑えつつ、生成速度を約2倍に向上できます。
5.1 Sage Attention のインストール
- SageAttention releases ページにアクセス
- PyTorch と CUDA のバージョンに適合する wheel ファイルをダウンロード
- インストール:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl
5.2 KJNodes カスタムノードのインストール
Sage Attention は KJNodes が提供するノードを介して使用します:
方法1:ComfyUI Manager を使用(推奨)
ComfyUI で Manager を開き、KJNodes を検索してインストールします。
方法2:手動インストール
cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# ComfyUI を再起動
5.3 ワークフローでの使用
- ワークフローに Patch Sage Attention KJ ノードを追加
- UNETLoader と BasicGuider ノードの間に接続:
model入力は UNETLoader からのモデルを受信model出力は BasicGuider のmodel入力に接続
sage_attentionをautoに設定- 通常通りワークフローを実行
グローバル有効化方法:
起動パラメータ付きで ComfyUI を起動:
python main.py --use-sage-attention
これにより、各ワークフローにノードを追加する必要がなくなります。
💡 ヒント:Sage Attention は float16 または bfloat16 テンソルを必要とします。MiniMax H3 の一部のレイヤーは他のデータ型を使用するため、コンソールに警告メッセージが表示される場合があります。これは正常な動作です。影響を受けるレイヤーは標準アテンションにフォールバックし、生成は正常に動作し続けます。
六、よくある質問
Q1:生成速度が遅いのはなぜですか?
考えられる原因:
- VRAM不足で過度な量子化を使用している
- メモリ不足(32GBが必要)
- Sage Attention が有効になっていない
- 解像度設定が高すぎる
解決策:
- 解像度を下げる(メガピクセルを 0.5〜0.8 に設定)
- Sage Attention を有効にする
- 他のメモリを消費するプログラムを閉じる
- GPU のアップグレードを検討する
Q2:生成された動画に音声がありませんか?
チェックリスト:
minimax_h3_audio_vae_fp32.safetensorsをダウンロードしたか確認- プロンプトで音声コンテンツ(セリフ、効果音、音楽)を記述したか確認
- ワークフローの音声出力ノードが正しく接続されているか確認
Q3:RTX 3060 12GB で動作しますか?
動作しますが、以下の点に注意してください:
- 量子化バージョン(pruned INT8 + NVFP4)を使用すること
- メモリは32GB必須
- 生成時間が長い(動画1本あたり5〜10分の可能性あり)
- 解像度を高く設定しすぎないこと
Q4:動画品質を向上させるには?
推奨事項:
- より高品質な量子化方式を使用する(Q4 でなく Q5)
- 解像度を上げる(メガピクセルを 1.0 に設定)
- 公式プロンプトガイドを参考に、丁寧にプロンプトを作成する
- 参照から動画(R2V)を使用してキャラクターとスタイルを固定する
Q5:どのくらいの長さの動画を生成できますか?
現在、MiniMax H3 の1回の生成で約 15秒(24fps)です。より長い動画が必要な場合は:
- 複数のクリップを生成して結合する
- 画像から動画(I2V)の最終フレームを次のセグメントの先頭フレームとして使用し、連続生成を行う
七、上級者向けリソース
- ComfyUI 公式ドキュメント:MiniMax H3 チュートリアル
- MiniMax H3 プロンプトガイド:公式ドキュメント
- Hugging Face モデルリポジトリ:Comfy-Org/MiniMax-H3
- コミュニティワークフロー共有:GitHub - ComfyUI_MiniMaxH3_Director
八、まとめ
MiniMax H3 のオープンソース化は、動画生成分野に新たな可能性をもたらしました。ComfyUI を通じて、ローカルで生成プロセスを完全に制御でき、ハードウェア構成からプロンプト作成まで、すべてのステップを細かく調整できます。
重要ポイントの振り返り:
- ハードウェア要件:RTX 3060 12GB が最低構成、RTX 4080 16GB を推奨
- インストール手順:ComfyUI 0.30.0+ → モデルファイルダウンロード → ワークフロー読み込み
- 3種類のワークフロー:T2V(テキストから動画)、I2V(画像から動画)、R2V(参照から動画)
- パフォーマンス最適化:Sage Attention を有効にすると約2倍の高速化
- プロンプトテクニック:シーン、カメラワーク、音声を記述し、参照素材をタグで参照する
これで、MiniMax H3 のローカルデプロイの全プロセスをマスターしました。AI動画の創作を始めましょう!
📌 あわせて読む: