Guide complet de déploiement local de MiniMax H3 : de la configuration matérielle aux flux de travail ComfyUI en pratique
MiniMax H3 est un modèle de génération multimodale universel développé par MiniMax, désormais disponible avec des poids ouverts. Il est capable de comprendre conjointement le texte, les images, la vidéo et l’audio dans un seul contexte, et de générer des vidéos avec audio stéréo natif — la parole, les effets sonores et la musique sont modélisés ensemble en un seul passage, sans post-traitement.
La sortie prend en charge jusqu’à 2K de résolution, 24fps, pour une durée d’environ 15 secondes. Plus important encore, H3 est maintenant open source, vous permettant de contrôler chaque paramètre en local.
Cet article vous guide de zéro jusqu’au déploiement complet de MiniMax H3 en local, couvrant la configuration matérielle, l’installation de ComfyUI, le téléchargement des modèles, trois flux de travail pratiques, et les astuces d’optimisation des performances.
I. Configuration matérielle requise : votre ordinateur peut-il le faire tourner ?
MiniMax H3 a des exigences matérielles élevées, mais reste à portée des cartes graphiques haut de gamme grand public. Selon les tests de la communauté, voici les recommandations de configuration par gamme de cartes graphiques :
Classement des cartes graphiques
| VRAM | Modèle de carte graphique | Niveau | Solution de quantification | Cas d’utilisation |
|---|---|---|---|---|
| 24Go+(RTX 5090/4090) | Flagship | FP16 / BF16 | Génération pleine qualité, vitesse maximale | |
| 16Go(RTX 4080 etc.) | Haut de gamme | Q5 / Q4 | Équilibre entre qualité et vitesse | |
| 12Go(RTX 3060/4070 Ti etc.) | Grand public | Q4 / pruned INT8 + NVFP4 | Configuration recommandée, testée fonctionnelle | |
| 8Go | Entrée de gamme | Quantification extrême | Fonctionne difficilement, expérience limitée |
Configuration minimale recommandée
- Carte graphique : NVIDIA RTX 3060 12Go (minimum confirmé par ComfyUI)
- RAM : 32Go (obligatoire, 16Go provoquera des dépassements mémoire)
- Système : Windows 10/11 ou Linux
- Version ComfyUI : 0.30.0 ou supérieure
Configuration recommandée (expérience fluide)
- Carte graphique : RTX 4080 16Go ou supérieure
- RAM : 32Go DDR4/DDR5
- Disque : SSD (les fichiers de modèles sont volumineux, les disques mécaniques sont lents)
💡 Données de test : Une RTX 4090 48Go (version modifiée) peut faire tourner le modèle en pleine précision ; une RTX 4080 16Go avec la version quantifiée offre un bon équilibre qualité/vitesse ; une RTX 3060 12Go avec 32Go de RAM fonctionne, mais les temps de génération sont longs.
II. Installation de ComfyUI
ComfyUI est la meilleure plateforme pour exécuter MiniMax H3, avec un support natif officiel des flux de travail H3.
2.1 Télécharger ComfyUI
Méthode 1 : Installateur officiel (recommandé pour les débutants)
Visitez le site officiel de ComfyUI et téléchargez l’installateur pour votre système :
- Windows : installateur
.exe - macOS : installateur
.dmg - Linux : AppImage ou installation manuelle
Méthode 2 : Installation depuis les sources GitHub (utilisateurs avancés)
# Cloner le dépôt
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# Créer un environnement virtuel (recommandé)
python -m venv venv
source venv/bin/activate # Linux/macOS
# venv\Scripts\activate # Windows
# Installer les dépendances
pip install -r requirements.txt
2.2 Mise à jour vers 0.30.0+
MiniMax H3 nécessite ComfyUI 0.30.0 ou supérieur. Si vous avez une version plus ancienne, mettez à jour :
# Installation depuis les sources
git pull
pip install -r requirements.txt --upgrade
Si vous utilisez l’installateur officiel, il vérifie automatiquement les mises à jour au démarrage.
2.3 Démarrer ComfyUI
# Installation depuis les sources
python main.py
# Ou utiliser le script de démarrage
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh
Après le démarrage, accédez à http://127.0.0.1:8188 pour voir l’interface.
III. Télécharger les fichiers de modèles MiniMax H3
Les fichiers de modèles MiniMax H3 sont hébergés sur le dépôt Hugging Face Comfy-Org/MiniMax-H3.
3.1 Liste des fichiers de modèles
Selon le type de flux de travail utilisé, vous devrez télécharger différents fichiers de modèles :
Flux de travail texte vers vidéo (T2V) et image vers vidéo (I2V)
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
Flux de travail référence vers vidéo (R2V)
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # Note : modèle de diffusion différent
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors # Partagé
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors # Partagé
│ └── minimax_h3_audio_vae_fp32.safetensors # Partagé
3.2 Méthodes de téléchargement
Méthode 1 : Utiliser Hugging Face CLI (recommandé)
# Installer huggingface_hub
pip install huggingface_hub
# Télécharger un fichier individuel
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_fl2va_pruned_int8_convrot.safetensors \
--local-dir ./ComfyUI/models/diffusion_models/
# Télécharger l'encodeur de texte
huggingface-cli download Comfy-Org/MiniMax-H3 \
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
--local-dir ./ComfyUI/models/text_encoders/
# Télécharger le VAE
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_video_vae_fp16.safetensors \
--local-dir ./ComfyUI/models/vae/
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_audio_vae_fp32.safetensors \
--local-dir ./ComfyUI/models/vae/
Méthode 2 : Téléchargement manuel via navigateur
Visitez le dépôt Hugging Face, cliquez sur le bouton de téléchargement à côté de chaque fichier, et téléchargez-les manuellement dans les répertoires correspondants.
Méthode 3 : Téléchargement automatique par ComfyUI
ComfyUI 0.30.0+ prend en charge le téléchargement automatique des fichiers de modèles manquants. Lors de la première exécution d’un flux de travail MiniMax H3, si des modèles sont détectés comme manquants, une boîte de dialogue vous guidera pour les télécharger.
3.3 Tailles des fichiers de modèles
- Modèle de diffusion : environ 10-15 Go (version quantifiée)
- Encodeur de texte : environ 20 Go (Qwen3-VL 32B)
- VAE : environ 1-2 Go
💡 Astuce : Si votre connexion est lente, vous pouvez utiliser un miroir Hugging Face ou un gestionnaire de téléchargement pour accélérer.
IV. Trois flux de travail en pratique
La bibliothèque de modèles ComfyUI fournit trois exemples de flux de travail MiniMax H3, couvrant trois modes de génération.
4.1 Texte vers vidéo (T2V)
Fonction : Générer une vidéo avec audio stéréo natif à partir d’un prompt textuel.
Étapes d’utilisation :
- Ouvrez ComfyUI, cliquez sur Workflow → Browse Templates dans le menu supérieur
- Trouvez MiniMax H3 T2V dans la catégorie Vidéo
- Cliquez pour charger le flux de travail
- Entrez votre prompt dans le nœud Prompt
- Ajustez le nœud Resolution Selector pour définir la résolution de sortie
- Cliquez sur Queue Prompt pour démarrer la génération
Astuces pour les prompts :
- Décrivez la scène entière : décrivez d’abord la scène globale (lieu, personnages, action), puis divisez-la en plusieurs plans chronologiques
- Plans, caméra et audio : décrivez les plans, les mouvements de caméra et l’audio accompagnant (dialogues, effets sonores, musique) dans le même bloc de prompt
- Résolution : Le côté court du canevas natif de H3 est de 768px, avec un maximum de 768×1344 pixels, arrondi aux multiples de 32
- Durée : La durée d’entrée sera alignée sur la grille de blocs de 17 images du modèle à 24fps
Exemple de prompt :
Une jeune fille se tient au bord d'un toit urbain, le coucher du soleil illuminant son visage. Elle se tourne vers la caméra et sourit en disant : "Bonjour, le monde."
La caméra avance lentement, les lumières de la ville s'allument progressivement en arrière-plan. On entend au loin le trafic et le bruissement du vent.
4.2 Image vers vidéo (I2V)
Fonction : Générer une vidéo à partir d’une image d’entrée, avec possibilité de spécifier des images clés de début/fin.
Étapes d’utilisation :
- Chargez le modèle de flux de travail MiniMax H3 I2V
- Téléchargez votre image d’entrée dans le nœud Load Image
- Optionnel : connectez une autre image à l’entrée last_frame comme image de fin
- Entrez un prompt décrivant le mouvement et l’audio souhaités
- Ajustez les paramètres et générez
Astuces pour les prompts :
- Images clés : Les entrées
first_frameetlast_framesont optionnelles ; le modèle génère le mouvement entre les deux - Prompt : Décrivez les plans, l’action et l’audio accompagnant dans le même bloc de texte
Exemple de prompt :
La caméra tourne lentement autour du produit, montrant ses détails à 360 degrés. L'arrière-plan reste blanc pur, avec un éclairage doux venant du dessus.
4.3 Référence vers vidéo (R2V)
Fonction : Générer une vidéo à partir de n’importe quelle combinaison d’images, vidéos et audios de référence, en verrouillant les personnages, le style, les mouvements, la caméra ou le son.
Étapes d’utilisation :
- Chargez le modèle de flux de travail MiniMax H3 R2V
- Téléchargez les images de référence des personnages dans le nœud Picture (jusqu’à 9)
- Téléchargez les vidéos de référence de style/mouvement dans le nœud Video (jusqu’à 3)
- Téléchargez les audios de référence dans le nœud Audio (jusqu’à 3)
- Entrez un prompt, en référençant chaque entrée par étiquette
Astuces pour les prompts :
- Référencement par étiquette : Référencez chaque entrée par étiquette, dans l’ordre exact de leur connexion, par exemple
<Picture 1>,<Video 1>,<Audio 1> - Attribuez une tâche à chaque référence : Indiquez quelle référence est responsable de quelle partie de l’image (identité, style, mouvement, caméra, son)
Exemple de prompt :
Le personnage de <Picture 1> porte une cape rouge et se tient sur un toit urbain. Le mouvement de caméra de <Video 1> est appliqué :
plan en contre-plongée, montant lentement. Le mouvement du personnage référence <Video 2> : il se tourne pour regarder au loin.
L'ambiance sonore référence <Audio 1> : le vent et le trafic lointain de la ville.
Limitations :
- Jusqu’à 9 images de référence
- Jusqu’à 3 vidéos de référence (chacune pouvant avoir sa propre bande-son)
- Jusqu’à 3 segments audio de référence indépendants
ref_image_size:matchréduit la référence à la résolution de génération pour plus de rapidité ;maxconserve le côté court jusqu’à 2048px pour une meilleure fidélité d’identité
⚠️ Note : R2V utilise le modèle de diffusion
ref2va, un ensemble de poids différent du modèlefl2vautilisé par les flux T2V et I2V. Assurez-vous de télécharger les bons fichiers de modèles.
V. Optimisation des performances : accélérer la génération avec Sage Attention
Le flux de travail par défaut utilise l’implémentation standard d’attention. Utiliser Sage Attention peut doubler la vitesse de génération avec une perte de qualité minimale.
5.1 Installer Sage Attention
- Visitez la page SageAttention releases
- Téléchargez le fichier wheel correspondant à votre version de PyTorch et CUDA
- Installez :
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl
5.2 Installer les nœuds personnalisés KJNodes
Sage Attention s’utilise via les nœuds fournis par KJNodes :
Méthode 1 : Utiliser ComfyUI Manager (recommandé)
Ouvrez le Manager dans ComfyUI, recherchez KJNodes et installez-le.
Méthode 2 : Installation manuelle
cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# Redémarrez ComfyUI
5.3 Utilisation dans le flux de travail
- Ajoutez le nœud Patch Sage Attention KJ au flux de travail
- Connectez-le entre les nœuds UNETLoader et BasicGuider :
- L’entrée
modelreçoit le modèle de UNETLoader - La sortie
modelse connecte à l’entréemodelde BasicGuider
- L’entrée
- Définissez
sage_attentionsurauto - Exécutez le flux de travail normalement
Activation globale :
Démarrez ComfyUI avec le paramètre de lancement :
python main.py --use-sage-attention
Cela évite d’ajouter le nœud à chaque flux de travail.
💡 Astuce : Sage Attention nécessite des tenseurs float16 ou bfloat16. Certaines couches de MiniMax H3 utilisent d’autres types de données, vous pourriez donc voir des messages d’avertissement dans la console. C’est normal ; les couches affectées reviennent à l’attention standard, et la génération fonctionne toujours correctement.
VI. FAQ
Q1 : Pourquoi ma génération est-elle lente ?
Causes possibles :
- VRAM insuffisante, quantification trop agressive
- RAM insuffisante (32Go nécessaires)
- Sage Attention non activé
- Résolution trop élevée
Solutions :
- Réduire la résolution (mégapixels réglé sur 0.5-0.8)
- Activer Sage Attention
- Fermer les autres programmes gourmands en mémoire
- Envisager une mise à niveau de la carte graphique
Q2 : La vidéo générée n’a pas de son ?
Liste de vérification :
- Vérifiez que vous avez téléchargé
minimax_h3_audio_vae_fp32.safetensors - Le prompt décrit le contenu audio (dialogues, effets sonores, musique)
- Les nœuds de sortie audio sont correctement connectés dans le flux de travail
Q3 : Une RTX 3060 12Go peut-elle le faire tourner ?
Oui, mais notez :
- Utilisez la version quantifiée (pruned INT8 + NVFP4)
- 32Go de RAM sont obligatoires
- Temps de génération plus longs (possiblement 5-10 minutes/vidéo)
- Ne réglez pas la résolution trop haut
Q4 : Comment améliorer la qualité vidéo ?
Recommandations :
- Utilisez une solution de quantification de meilleure qualité (Q5 plutôt que Q4)
- Augmentez la résolution (mégapixels réglé sur 1.0)
- Rédigez soigneusement vos prompts, en vous référant au guide officiel
- Utilisez la référence vers vidéo (R2V) pour verrouiller les personnages et le style
Q5 : Quelle durée de vidéo peut-on générer ?
Actuellement, MiniMax H3 génère des vidéos d’environ 15 secondes (24fps) en une seule passe. Pour des vidéos plus longues, vous pouvez :
- Générer plusieurs segments puis les assembler
- Utiliser la dernière image d’une génération I2V comme première image de la suivante pour une génération continue
VII. Ressources avancées
- Documentation officielle de ComfyUI : Tutoriel MiniMax H3
- Guide de prompts MiniMax H3 : Documentation officielle
- Dépôt de modèles Hugging Face : Comfy-Org/MiniMax-H3
- Partage de flux de travail communautaires : GitHub - ComfyUI_MiniMaxH3_Director
VIII. Conclusion
L’open source de MiniMax H3 ouvre de nouvelles possibilités dans le domaine de la génération vidéo. Avec ComfyUI, vous pouvez contrôler entièrement le processus de génération en local, de la configuration matérielle à la rédaction des prompts, chaque étape pouvant être finement ajustée.
Points clés à retenir :
- Configuration matérielle : RTX 3060 12Go est le minimum, RTX 4080 16Go recommandé
- Étapes d’installation : ComfyUI 0.30.0+ → Télécharger les modèles → Charger le flux de travail
- Trois flux de travail : T2V (texte vers vidéo), I2V (image vers vidéo), R2V (référence vers vidéo)
- Optimisation des performances : Activer Sage Attention pour doubler la vitesse
- Astuces de prompts : Décrivez la scène, les plans, l’audio, référencez les éléments par étiquette
Vous maîtrisez maintenant le processus complet de déploiement local de MiniMax H3. Commencez à créer vos vidéos IA !
📌 Lectures complémentaires :