MiniMax H3 Lokaler Bereitstellungsleitfaden: Von der Hardware-Konfiguration bis zum ComfyUI-Workflow in der Praxis
MiniMax H3 ist ein universelles, multimodales Generierungsmodell von MiniMax, das jetzt als Open-Weights-Modell verfügbar ist. Es kann Text, Bilder, Video und Audio in einem einzigen Kontext gemeinsam verstehen und Videos mit nativem Stereo-Audio generieren – Sprache, Soundeffekte und Musik werden in einem einzigen Forward-Pass modelliert, anstatt nachträglich hinzugefügt zu werden.
Die Ausgabe unterstützt bis zu 2K-Auflösung bei 24 fps mit einer Dauer von etwa 15 Sekunden. Noch wichtiger: H3 ist jetzt Open Source, sodass Sie lokal die vollständige Kontrolle über jeden Parameter haben.
Dieser Artikel führt Sie von Null an durch die lokale Bereitstellung von MiniMax H3 – von der Hardware-Konfiguration über die ComfyUI-Installation und Modell-Downloads bis hin zu drei praktischen Workflows und Optimierungstipps.
1. Hardware-Anforderungen: Kann Ihr Computer es ausführen?
MiniMax H3 stellt hohe Anforderungen an die Hardware, liegt aber bereits im Bereich hochwertiger Consumer-Grafikkarten. Basierend auf Community-Tests hier die Konfigurationsempfehlungen für verschiedene GPU-Klassen:
GPU-Rangliste
| VRAM | GPU-Modell | Quantisierung | Einsatzszenario |
|---|---|---|---|
| 24GB+ (RTX 5090/4090) | Flaggschiff | FP16 / BF16 | Vollqualitätsgenerierung, höchste Geschwindigkeit |
| 16GB (RTX 4080 usw.) | High-End | Q5 / Q4 | Balance zwischen Bildqualität und Geschwindigkeit |
| 12GB (RTX 3060/4070 Ti usw.) | Mainstream | Q4 / pruned INT8 + NVFP4 | Empfohlene Konfiguration, nachweislich lauffähig |
| 8GB | Einstieg | Extreme Quant. | Knapp lauffähig, aber eingeschränktes Erlebnis |
Mindestkonfiguration
- GPU: NVIDIA RTX 3060 12GB (von ComfyUI offiziell bestätigte Untergrenze)
- RAM: 32GB (Pflicht, 16GB führen zu Speicherüberlauf)
- System: Windows 10/11 oder Linux
- ComfyUI-Version: 0.30.0 oder höher
Empfohlene Konfiguration (flüssiges Erlebnis)
- GPU: RTX 4080 16GB oder höher
- RAM: 32GB DDR4/DDR5
- Festplatte: SSD (Modell Dateien sind groß, HDDs laden langsam)
💡 Testdaten: RTX 4090 48GB (modifizierte Version) kann das Modell in voller Präzision flüssig ausführen; RTX 4080 16GB mit quantisierter Version bietet gute Balance zwischen Qualität und Geschwindigkeit; RTX 3060 12GB mit 32GB RAM kann es ausführen, aber die Generierungszeit ist länger.
2. ComfyUI installieren
ComfyUI ist die beste Plattform zum Ausführen von MiniMax H3, mit offizieller nativer Unterstützung für H3-Workflows.
2.1 ComfyUI herunterladen
Methode 1: Offizielles Installationspaket (empfohlen für Einsteiger)
Besuchen Sie die ComfyUI-Website und laden Sie das Installationspaket für Ihr System herunter:
- Windows:
.exe-Installationsprogramm - macOS:
.dmg-Installationsprogramm - Linux: AppImage oder manuelle Installation
Methode 2: Installation aus dem GitHub-Quellcode (empfohlen für fortgeschrittene Nutzer)
# Repository klonen
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# Virtuelle Umgebung erstellen (empfohlen)
python -m venv venv
source venv/bin/activate # Linux/macOS
# venv\Scripts\activate # Windows
# Abhängigkeiten installieren
pip install -r requirements.txt
2.2 Auf 0.30.0+ aktualisieren
MiniMax H3 benötigt ComfyUI Version 0.30.0 oder höher. Wenn Sie eine ältere Version haben, aktualisieren Sie bitte:
# Bei Installation aus Quellcode
git pull
pip install -r requirements.txt --upgrade
Bei der offiziellen Installationsversion wird beim Start automatisch nach Updates gesucht.
2.3 ComfyUI starten
# Bei Installation aus Quellcode
python main.py
# Oder Startskripte verwenden:
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh
Nach dem Start öffnen Sie http://127.0.0.1:8188 im Browser, um die Oberfläche zu sehen.
3. MiniMax H3 Modell Dateien herunterladen
Die Modell Dateien von MiniMax H3 werden im Hugging Face-Repository Comfy-Org/MiniMax-H3 gehostet.
3.1 Modell Dateiliste
Je nach verwendetem Workflow-Typ müssen unterschiedliche Modell Dateien heruntergeladen werden:
Text-zu-Video (T2V) und Bild-zu-Video (I2V) Workflows
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
Referenz-zu-Video (R2V) Workflow
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # Hinweis: anderes Diffusionsmodell
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors # gemeinsam genutzt
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors # gemeinsam genutzt
│ └── minimax_h3_audio_vae_fp32.safetensors # gemeinsam genutzt
3.2 Download-Methoden
Methode 1: Hugging Face CLI verwenden (empfohlen)
# huggingface_hub installieren
pip install huggingface_hub
# Einzelne Datei herunterladen
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_fl2va_pruned_int8_convrot.safetensors \
--local-dir ./ComfyUI/models/diffusion_models/
# Text-Encoder herunterladen
huggingface-cli download Comfy-Org/MiniMax-H3 \
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
--local-dir ./ComfyUI/models/text_encoders/
# VAE herunterladen
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_video_vae_fp16.safetensors \
--local-dir ./ComfyUI/models/vae/
huggingface-cli download Comfy-Org/MiniMax-H3 \
minimax_h3_audio_vae_fp32.safetensors \
--local-dir ./ComfyUI/models/vae/
Methode 2: Manueller Download im Browser
Besuchen Sie das Hugging Face-Repository, klicken Sie auf den Download-Button neben den Dateien und laden Sie sie manuell in die entsprechenden Verzeichnisse herunter.
Methode 3: Automatischer Download durch ComfyUI
ComfyUI 0.30.0+ unterstützt den automatischen Download fehlender Modell Dateien. Wenn Sie zum ersten Mal einen MiniMax H3-Workflow ausführen und fehlende Modelle erkannt werden, erscheint ein Dialogfeld, das Sie durch den Download führt.
3.3 Größenreferenz der Modell Dateien
- Diffusionsmodell: ca. 10–15 GB (quantisierte Version)
- Text-Encoder: ca. 20 GB (Qwen3-VL 32B)
- VAE: ca. 1–2 GB
💡 Tipp: Bei langsamer Netzwerkverbindung können Sie Hugging Face-Mirror-Sites oder Download-Tools zur Beschleunigung verwenden.
4. Drei Workflows in der Praxis
Die ComfyUI-Vorlagenbibliothek bietet drei MiniMax H3-Beispielworkflows, die drei Generierungsmodi abdecken.
4.1 Text-zu-Video (T2V)
Funktion: Generiert Videos mit nativem Stereo-Audio basierend auf Text-Prompts.
Verwendung:
- Öffnen Sie ComfyUI und klicken Sie im oberen Menü auf Workflow → Vorlagen durchsuchen
- In der Kategorie Video finden Sie MiniMax H3 T2V
- Klicken Sie, um den Workflow zu laden
- Geben Sie Ihren Prompt im Prompt-Knoten ein
- Passen Sie die Ausgab auflösung im Resolution Selector-Knoten an
- Klicken Sie auf Queue Prompt, um die Generierung zu starten
Prompt-Tipps:
- Gesamte Szene beschreiben: Beschreiben Sie zuerst die Gesamtszene (Ort, Personen, was passiert) und teilen Sie sie dann zeitlich in mehrere Aufnahmen auf
- Aufnahme, Kamera und Audio: Beschreiben Sie Aufnahme, Kamerabewegung und begleitendes Audio (Dialoge, Soundeffekte, Musik) im selben Prompt-Block
- Auflösung: Die native Canvas-Kurzseite von H3 beträgt 768px, das Maximum ist 768×1344 Pixel, gerundet auf Vielfache von 32
- Dauer: Die Dauer-Eingabe wird am 17-Frames-Raster des Modells bei 24fps ausgerichtet
Beispiel-Prompt:
Ein junges Mädchen steht am Rand einer Dachterrasse in der Stadt, der Sonnenuntergang beleuchtet ihr Gesicht. Sie dreht sich zur Kamera, lächelt und sagt: "Hallo, Welt."
Die Kamera fährt langsam näher, im Hintergrund gehen nach und nach die Stadtlichter an. In der Ferne hört man Verkehr und eine sanfte Brise.
4.2 Bild-zu-Video (I2V)
Funktion: Generiert Videos aus einem Eingabebild, optional mit Angabe von Start-/End-Keyframes.
Verwendung:
- Laden Sie die MiniMax H3 I2V Workflow-Vorlage
- Laden Sie Ihr Eingabebild im Load Image-Knoten hoch
- Optional: Verbinden Sie im last_frame-Eingang ein weiteres Bild als End-Frame
- Geben Sie einen Prompt ein, der die gewünschte Bewegung und das Audio beschreibt
- Passen Sie die Parameter an und generieren Sie
Prompt-Tipps:
- Keyframes: Die Eingänge
first_frameundlast_framesind optional; das Modell generiert die Bewegung dazwischen - Prompt: Beschreiben Sie Aufnahme, Aktion und begleitendes Audio im selben Textblock
Beispiel-Prompt:
Die Kamera dreht sich langsam um das Produkt und zeigt 360-Grad-Details. Der Hintergrund bleibt rein weiß, sanftes Licht fällt von oben herab.
4.3 Referenz-zu-Video (R2V)
Funktion: Generiert Videos aus einer beliebigen Kombination von Referenzbildern, -videos und -audios, wobei Charakter, Stil, Bewegung, Kameraführung oder Stimme fixiert werden.
Verwendung:
- Laden Sie die MiniMax H3 R2V Workflow-Vorlage
- Laden Sie Charakter-Referenzbilder im Picture-Eingangsknoten hoch (bis zu 9)
- Laden Sie Stil-/Bewegungsreferenzvideos im Video-Eingangsknoten hoch (bis zu 3)
- Laden Sie Stimmreferenz-Audios im Audio-Eingangsknoten hoch (bis zu 3)
- Geben Sie einen Prompt ein und referenzieren Sie jede Eingabe mit Tags
Prompt-Tipps:
- Referenzierung mit Tags: Referenzieren Sie jede Eingabe mit Tags, die Reihenfolge muss exakt mit der Verbindungsreihenfolge übereinstimmen, z.B.
<Picture 1>,<Video 1>,<Audio 1> - Jeder Referenz eine Aufgabe zuweisen: Geben Sie an, welche Referenz für welchen Teil des Bildes verantwortlich ist (Identität, Stil, Bewegung, Kamera, Stimme)
Beispiel-Prompt:
Der Charakter aus <Picture 1> trägt einen roten Umhang und steht auf einem Stadtdach. Die Kamerabewegung aus <Video 1> wird angewendet:
Die Kamera filmt aus niedriger Perspektive und hebt sich langsam an. Die Bewegung des Charakters folgt <Video 2>: Er dreht sich um und blickt in die Ferne.
Hintergrund-Soundeffekte folgen <Audio 1>: Wind und entfernter Stadtverkehr.
Einschränkungen:
- Bis zu 9 Referenzbilder
- Bis zu 3 Referenzvideos (jedes mit eigenem Soundtrack möglich)
- Bis zu 3 separate Referenz-Audio-Clips
ref_image_size:matchverkleinert die Referenz auf die Generierungs auflösung für höhere Geschwindigkeit;maxbehält bis zu 2048px auf der kurzen Seite für stärkere Identitätstreue
⚠️ Hinweis: R2V verwendet das
ref2va-Diffusionsmodell – ein anderer Gewichtungssatz als diefl2va-Modelle für T2V- und I2V-Workflows. Stellen Sie sicher, dass Sie die richtigen Modell Dateien herunterladen.
5. Leistungsoptimierung: Generierung mit Sage Attention beschleunigen
Der Standard-Workflow verwendet die Standard-Attention-Implementierung. Mit Sage Attention können Sie die Generierungs geschwindigkeit bei minimalem Qualitätsverlust etwa verdoppeln.
5.1 Sage Attention installieren
- Besuchen Sie die SageAttention Releases-Seite
- Laden Sie die zu Ihrer PyTorch- und CUDA-Version passende Wheel-Datei herunter
- Installieren:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl
5.2 KJNodes Custom Node installieren
Sage Attention muss über einen von KJNodes bereitgestellten Knoten verwendet werden:
Methode 1: ComfyUI Manager verwenden (empfohlen)
Öffnen Sie den Manager in ComfyUI, suchen Sie nach KJNodes und installieren Sie ihn.
Methode 2: Manuelle Installation
cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# ComfyUI neu starten
5.3 Im Workflow verwenden
- Fügen Sie den Knoten Patch Sage Attention KJ zum Workflow hinzu
- Verbinden Sie ihn zwischen den Knoten UNETLoader und BasicGuider:
- Der
model-Eingang empfängt das Modell vom UNETLoader - Der
model-Ausgang wird mit demmodel-Eingang von BasicGuider verbunden
- Der
- Setzen Sie
sage_attentionaufauto - Führen Sie den Workflow wie gewohnt aus
Globale Aktivierung:
Starten Sie ComfyUI mit dem Startparameter:
python main.py --use-sage-attention
So entfällt das Hinzufügen des Knotens in jedem Workflow.
💡 Tipp: Sage Attention erfordert float16- oder bfloat16-Tensoren. Einige Schichten von MiniMax H3 verwenden andere Datentypen, daher sehen Sie möglicherweise Warnungen in der Konsole. Das ist normal; betroffene Schichten fallen auf Standard-Attention zurück, die Generierung funktioniert weiterhin.
6. Häufig gestellte Fragen
F1: Warum ist meine Generierungs geschwindigkeit so langsam?
Mögliche Ursachen:
- VRAM unzureichend, übermäßige Quantisierung verwendet
- RAM unzureichend (32GB erforderlich)
- Sage Attention nicht aktiviert
- Auflösung zu hoch eingestellt
Lösungen:
- Auflösung reduzieren (Megapixel-Einstellung auf 0,5–0,8)
- Sage Attention aktivieren
- Andere speicherintensive Programme schließen
- GPU-Upgrade in Betracht ziehen
F2: Das generierte Video hat keinen Ton?
Checkliste:
- Stellen Sie sicher, dass
minimax_h3_audio_vae_fp32.safetensorsheruntergeladen wurde - Der Prompt beschreibt Audioinhalte (Dialoge, Soundeffekte, Musik)
- Der Audio-Ausgangsknoten im Workflow ist korrekt verbunden
F3: Kann es auf einer RTX 3060 12GB ausgeführt werden?
Ja, aber beachten Sie:
- Verwenden Sie die quantisierte Version (pruned INT8 + NVFP4)
- RAM muss 32GB betragen
- Längere Generierungszeit (möglicherweise 5–10 Minuten/Video)
- Auflösung nicht zu hoch einstellen
F4: Wie kann ich die Videoqualität verbessern?
Empfehlungen:
- Höherwertige Quantisierung verwenden (Q5 statt Q4)
- Auflösung erhöhen (Megapixel-Einstellung auf 1,0)
- Prompts sorgfältig formulieren, den offiziellen Prompt-Leitfaden beachten
- Referenz-zu-Video (R2V) verwenden, um Charakter und Stil zu fixieren
F5: Wie lange können Videos sein?
Aktuell beträgt die Generierungs dauer von MiniMax H3 etwa 15 Sekunden bei 24 fps. Für längere Videos können Sie:
- Mehrere Clips generieren und zusammenfügen
- Den Endframe eines Bild-zu-Video (I2V)-Clips als Startframe des nächsten verwenden, um fortlaufend zu generieren
7. Weiterführende Ressourcen
- ComfyUI offizielle Dokumentation: MiniMax H3 Tutorial
- MiniMax H3 Prompt-Leitfaden: Offizielle Dokumentation
- Hugging Face Modell-Repository: Comfy-Org/MiniMax-H3
- Community-Workflow-Sharing: GitHub - ComfyUI_MiniMaxH3_Director
8. Fazit
Die Open-Source-Veröffentlichung von MiniMax H3 bringt neue Möglichkeiten in die Videogenerierung. Mit ComfyUI können Sie den Generierungsprozess lokal vollständig kontrollieren – von der Hardware-Konfiguration bis zur Prompt-Erstellung kann jeder Schritt fein abgestimmt werden.
Wichtigste Punkte im Überblick:
- Hardware-Anforderungen: RTX 3060 12GB ist die Mindestkonfiguration, RTX 4080 16GB wird empfohlen
- Installationsschritte: ComfyUI 0.30.0+ → Modell Dateien herunterladen → Workflow laden
- Drei Workflows: T2V (Text-zu-Video), I2V (Bild-zu-Video), R2V (Referenz-zu-Video)
- Leistungsoptimierung: Sage Attention aktivieren verdoppelt die Geschwindigkeit etwa
- Prompt-Techniken: Szene, Aufnahme, Audio beschreiben, Referenzen mit Tags referenzieren
Jetzt kennen Sie den vollständigen Prozess der lokalen Bereitstellung von MiniMax H3. Beginnen Sie mit der Erstellung Ihrer KI-Videos!
📌 Weiterführende Artikel: