MiniMax H3 로컬 배포 완전 가이드: 하드웨어 구성부터 ComfyUI 워크플로우 실전까지

MiniMax H3 로컬 배포 완전 가이드: 하드웨어 구성부터 ComfyUI 워크플로우 실전까지

MiniMax H3 로컬 배포 완전 가이드: 하드웨어 구성부터 ComfyUI 워크플로우 실전까지

MiniMax H3는 MiniMax에서 출시한 범용 전역 멀티모달 생성 모델로, 현재 오픈 웨이트로 제공됩니다. 단일 컨텍스트에서 텍스트, 이미지, 비디오, 오디오를 통합적으로 이해하고, 네이티브 스테레오 오디오가 포함된 비디오를 생성합니다 — 음성, 사운드 효과, 음악이 단일 포워드 패스에서 함께 모델링되며, 사후 합성이 아닙니다.

출력은 최대 2K 해상도, 24fps를 지원하며, 길이는 약 15초입니다. 무엇보다도, H3는 이제 오픈소스이므로 로컬에서 모든 파라미터를 완전히 제어할 수 있습니다.

이 글에서는 MiniMax H3의 로컬 배포를 처음부터 완료하는 과정을 안내합니다. 하드웨어 구성, ComfyUI 설치, 모델 다운로드, 세 가지 워크플로우 실전, 그리고 성능 최적화 팁을 다룹니다.


1. 하드웨어 구성 요구사항: 내 컴퓨터로 실행 가능할까?

MiniMax H3는 높은 하드웨어 요구사항을 가지지만, 소비자용 하이엔드 그래픽카드가 도달 가능한 범위에 들어왔습니다. 커뮤니티 실측에 따르면, 각 그래픽카드 등급별 구성 권장 사항은 다음과 같습니다:

그래픽카드 계층표

VRAM그래픽카드 모델양자화 방식사용 시나리오
24GB+(RTX 5090/4090)플래그십FP16 / BF16최고 품질 생성, 가장 빠른 속도
16GB(RTX 4080 등)하이엔드Q5 / Q4화질과 생성 속도 균형
12GB(RTX 3060/4070 Ti 등)메인스트림Q4 / pruned INT8 + NVFP4권장 구성, 실측 실행 가능
8GB엔트리극한 양자화간신히 실행 가능하나 경험 떨어짐

최소 구성 권장

  • 그래픽카드: NVIDIA RTX 3060 12GB(ComfyUI 공식 확인 최소 사양)
  • 메모리: 32GB(필수, 16GB는 메모리 부족 발생)
  • 시스템: Windows 10/11 또는 Linux
  • ComfyUI 버전: 0.30.0 이상

권장 구성(원활한 경험)

  • 그래픽카드: RTX 4080 16GB 이상
  • 메모리: 32GB DDR4/DDR5
  • 하드디스크: SSD(모델 파일이 크므로 HDD는 로딩 느림)

💡 실측 데이터: RTX 4090 48GB(개조 버전)는 전 정밀도 모델을 원활히 실행 가능; RTX 4080 16GB는 양자화 버전으로 화질과 속도 균형 가능; RTX 3060 12GB는 32GB 메모리와 함께 실행 가능하나 생성 시간이 김.


2. ComfyUI 설치

ComfyUI는 MiniMax H3를 실행하기 위한 최적의 플랫폼이며, 공식적으로 H3 워크플로우를 네이티브 지원합니다.

2.1 ComfyUI 다운로드

방법 1: 공식 설치 패키지(초보자 권장)

ComfyUI 공식 사이트에서 해당 시스템의 설치 패키지를 다운로드합니다:

  • Windows: .exe 설치 프로그램
  • macOS: .dmg 설치 프로그램
  • Linux: AppImage 또는 수동 설치

방법 2: GitHub 소스에서 설치(숙련 사용자 권장)

# 저장소 클론
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI

# 가상 환경 생성(권장)
python -m venv venv
source venv/bin/activate  # Linux/macOS
# venv\Scripts\activate   # Windows

# 의존성 설치
pip install -r requirements.txt

2.2 0.30.0+로 업데이트

MiniMax H3는 ComfyUI 0.30.0 이상이 필요합니다. 기존 버전이 있다면 업데이트하세요:

# 소스 설치 방식
git pull
pip install -r requirements.txt --upgrade

공식 설치 패키지의 경우, 시작 시 자동으로 업데이트를 확인합니다.

2.3 ComfyUI 시작

# 소스 설치 방식
python main.py

# 또는 시작 스크립트 사용
# Windows: run_nvidia_gpu.bat
# macOS: run_macos.sh
# Linux: run_nvidia_gpu.sh

시작 후 http://127.0.0.1:8188에 접속하면 인터페이스를 볼 수 있습니다.


3. MiniMax H3 모델 파일 다운로드

MiniMax H3의 모델 파일은 Hugging Face의 Comfy-Org/MiniMax-H3 저장소에 호스팅되어 있습니다.

3.1 모델 파일 목록

사용하는 워크플로우 유형에 따라 다른 모델 파일을 다운로드해야 합니다:

텍스트→비디오(T2V)및 이미지→비디오(I2V)워크플로우

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

레퍼런스→비디오(R2V)워크플로우

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # 주의: 다른 확산 모델
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors  # 공통
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors  # 공통
│       └── minimax_h3_audio_vae_fp32.safetensors  # 공통

3.2 다운로드 방법

방법 1: Hugging Face CLI 사용(권장)

# huggingface_hub 설치
pip install huggingface_hub

# 개별 파일 다운로드
huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  --local-dir ./ComfyUI/models/diffusion_models/

# 텍스트 인코더 다운로드
huggingface-cli download Comfy-Org/MiniMax-H3 \
  qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  --local-dir ./ComfyUI/models/text_encoders/

# VAE 다운로드
huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_video_vae_fp16.safetensors \
  --local-dir ./ComfyUI/models/vae/

huggingface-cli download Comfy-Org/MiniMax-H3 \
  minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ./ComfyUI/models/vae/

방법 2: 브라우저 수동 다운로드

Hugging Face 저장소에 접속하여 파일 옆의 다운로드 버튼을 클릭해 해당 디렉토리에 수동으로 다운로드합니다.

방법 3: ComfyUI 자동 다운로드 사용

ComfyUI 0.30.0+는 누락된 모델 파일을 자동으로 다운로드합니다. MiniMax H3 워크플로우를 처음 실행할 때 모델이 누락되어 있으면 안내 팝업이 표시됩니다.

3.3 모델 파일 크기 참고

  • 확산 모델: 약 10-15 GB(양자화 버전)
  • 텍스트 인코더: 약 20 GB(Qwen3-VL 32B)
  • VAE: 약 1-2 GB

💡 팁: 네트워크가 느린 경우 Hugging Face 미러 사이트나 다운로드 도구를 사용해 가속할 수 있습니다.


4. 세 가지 워크플로우 실전

ComfyUI 템플릿 라이브러리는 세 가지 생성 모드를 커버하는 세 개의 MiniMax H3 예제 워크플로우를 제공합니다.

4.1 텍스트→비디오(T2V)

기능: 텍스트 프롬프트에 따라 네이티브 스테레오 오디오가 포함된 비디오를 생성합니다.

사용 단계:

  1. ComfyUI를 열고 상단 메뉴에서 Workflow → Browse Templates 클릭
  2. Video 카테고리에서 MiniMax H3 T2V 찾기
  3. 클릭하여 워크플로우 로드
  4. Prompt 노드에서 프롬프트 입력
  5. Resolution Selector 노드에서 출력 해상도 설정 조정
  6. Queue Prompt 클릭하여 생성 시작

프롬프트 팁:

  • 전체 장면 묘사: 먼저 전체 장면(장소, 인물, 일어나고 있는 일)을 묘사한 후 시간순으로 여러 샷으로 분할
  • 샷, 카메라, 오디오: 동일한 프롬프트 블록에서 샷, 카메라 움직임, 동반 오디오(대화, 사운드 효과, 음악)를 묘사
  • 해상도: H3의 네이티브 캔버스 짧은 변은 768px, 상한은 768×1344 픽셀, 32의 배수로 반올림
  • 길이: 길이 입력은 24fps에서 모델의 17프레임 그리드 블록에 정렬됨

예제 프롬프트:

한 젊은 소녀가 도시 옥상 끝에 서 있고, 석양이 그녀의 얼굴에 비친다. 
그녀는 카메라를 향해 고개를 돌려 미소 지으며 말한다: "안녕, 세상."
카메라가 천천히 다가오고, 배경의 도시 불빛이 서서히 켜진다. 
멀리서 차 소리와 바람 소리가 들린다.

4.2 이미지→비디오(I2V)

기능: 입력 이미지에 따라 비디오를 생성하며, 선택적으로 첫 프레임/마지막 프레임 키프레임을 지정할 수 있습니다.

사용 단계:

  1. MiniMax H3 I2V 워크플로우 템플릿 로드
  2. Load Image 노드에서 입력 이미지 업로드
  3. 선택 사항: last_frame 입력에 다른 이미지를 마지막 프레임으로 연결
  4. 프롬프트에 원하는 움직임과 오디오 묘사
  5. 파라미터 조정 후 생성

프롬프트 팁:

  • 키프레임: first_frame과 last_frame 입력은 선택 사항; 모델이 그 사이의 움직임을 생성
  • 프롬프트: 동일한 텍스트 블록에서 샷, 동작, 동반 오디오를 묘사

예제 프롬프트:

카메라가 제품을 천천히 회전하며 360도 디테일을 보여준다. 
배경은 순백색을 유지하고, 위에서 부드러운 조명이 비춘다.

4.3 레퍼런스→비디오(R2V)

기능: 레퍼런스 이미지, 비디오, 오디오의 임의 조합에서 비디오를 생성하여 캐릭터, 스타일, 동작, 카메라 워크 또는 사운드를 고정합니다.

사용 단계:

  1. MiniMax H3 R2V 워크플로우 템플릿 로드
  2. Picture 입력 노드에 캐릭터 레퍼런스 이미지 업로드(최대 9장)
  3. Video 입력 노드에 스타일/동작 레퍼런스 비디오 업로드(최대 3개)
  4. Audio 입력 노드에 사운드 레퍼런스 오디오 업로드(최대 3개)
  5. 프롬프트를 입력하고 태그로 각 입력을 참조

프롬프트 팁:

  • 태그로 참조: 각 입력을 태그로 참조하며, 순서는 연결 시와 정확히 일치해야 함. 예: <Picture 1>, <Video 1>, <Audio 1>
  • 각 레퍼런스에 작업 할당: 어떤 레퍼런스가 화면의 어떤 부분을 담당하는지 명시(정체성, 스타일, 동작, 카메라, 사운드)

예제 프롬프트:

<Picture 1>의 캐릭터가 붉은 망토를 입고 도시 옥상에 서 있다.
<Video 1>의 카메라 움직임이 적용된다:
카메라가 로우 앵글에서 천천히 상승한다.
캐릭터의 동작은 <Video 2>를 레퍼런스로: 돌아서서 먼 곳을 바라본다.
배경 사운드는 <Audio 1>을 레퍼런스로: 바람 소리와 도시 멀리서 들리는 교통 소리.

제한 사항:

  • 최대 9장의 레퍼런스 이미지
  • 최대 3개의 레퍼런스 비디오(각각 자체 사운드트랙 포함 가능)
  • 최대 3개의 독립 레퍼런스 오디오 클립
  • ref_image_size: match는 레퍼런스를 생성 해상도로 축소하여 속도 향상; max는 짧은 변 최대 2048px를 유지하여 더 강한 정체성 충실도 확보

⚠️ 주의: R2V는 ref2va 확산 모델을 사용하며, 이는 T2V 및 I2V 워크플로우에서 사용되는 fl2va 모델과 다른 웨이트입니다. 올바른 모델 파일을 다운로드했는지 확인하세요.


5. 성능 최적화: Sage Attention으로 생성 가속

기본 워크플로우는 표준 어텐션 구현을 사용합니다. Sage Attention을 사용하면 생성 속도를 약 2배 향상시킬 수 있으며, 품질 손실은 극히 적습니다.

5.1 Sage Attention 설치

  1. SageAttention releases 페이지 방문
  2. PyTorch 및 CUDA 버전과 일치하는 wheel 파일 다운로드
  3. 설치:
pip install sageattention-<version>+cu<cuda_version>-cp<python_version>.whl

5.2 KJNodes 커스텀 노드 설치

Sage Attention은 KJNodes가 제공하는 노드를 통해 사용해야 합니다:

방법 1: ComfyUI Manager 사용(권장)

ComfyUI에서 Manager를 열고 KJNodes를 검색하여 설치합니다.

방법 2: 수동 설치

cd ComfyUI/custom_nodes/
git clone https://github.com/kijai/ComfyUI-KJNodes.git
# ComfyUI 재시작

5.3 워크플로우에서 사용

  1. 워크플로우에 Patch Sage Attention KJ 노드 추가
  2. UNETLoader와 BasicGuider 노드 사이에 연결:
    • model 입력은 UNETLoader의 모델을 수신
    • model 출력은 BasicGuider의 model 입력에 연결
  3. sage_attention을 auto로 설정
  4. 평소대로 워크플로우 실행

전역 활성화 방법:

시작 파라미터로 ComfyUI 시작:

python main.py --use-sage-attention

이렇게 하면 각 워크플로우에 노드를 추가할 필요가 없습니다.

💡 팁: Sage Attention은 float16 또는 bfloat16 텐서를 요구합니다. MiniMax H3의 일부 레이어는 다른 데이터 타입을 사용하므로 콘솔에서 경고 메시지를 볼 수 있습니다. 이는 정상 현상이며, 영향을 받는 레이어는 표준 어텐션으로 폴백하고 생성은 여전히 정상 작동합니다.


6. 자주 묻는 질문

Q1: 생성 속도가 왜 이렇게 느린가요?

가능한 원인:

  • VRAM 부족으로 과도한 양자화 사용
  • 메모리 부족(32GB 필요)
  • Sage Attention 미활성화
  • 해상도 과도하게 높게 설정

해결 방법:

  • 해상도 낮추기(메가픽셀을 0.5-0.8로 설정)
  • Sage Attention 활성화
  • 메모리를 점유하는 다른 프로그램 종료
  • 그래픽카드 업그레이드 고려

Q2: 생성된 비디오에 소리가 없나요?

체크리스트:

  • minimax_h3_audio_vae_fp32.safetensors를 다운로드했는지 확인
  • 프롬프트에 오디오 내용(대화, 사운드 효과, 음악)을 묘사했는지 확인
  • 워크플로우에서 오디오 출력 노드가 올바르게 연결되었는지 확인

Q3: RTX 3060 12GB로 실행 가능한가요?

가능합니다, 단 다음 사항에 주의하세요:

  • 양자화 버전 사용(pruned INT8 + NVFP4)
  • 메모리는 반드시 32GB 필요
  • 생성 시간이 김(비디오당 5-10분 가능)
  • 해상도를 너무 높게 설정하지 말 것

Q4: 비디오 품질을 높이려면?

권장 사항:

  • 더 높은 품질의 양자화 방식 사용(Q4 대신 Q5)
  • 해상도 높이기(메가픽셀을 1.0으로 설정)
  • 프롬프트를 정성껏 작성, 공식 프롬프트 가이드 참조
  • 레퍼런스→비디오(R2V)로 캐릭터와 스타일 고정

Q5: 얼마나 긴 비디오를 생성할 수 있나요?

현재 MiniMax H3는 단일 생성 시 약 15초(24fps)입니다. 더 긴 비디오가 필요하면:

  • 여러 클립을 생성한 후 연결
  • 이미지→비디오(I2V)의 마지막 프레임을 다음 클립의 첫 프레임으로 사용하여 연속 생성

7. 심화 자료


8. 요약

MiniMax H3의 오픈소스화는 비디오 생성 분야에 새로운 가능성을 열었습니다. ComfyUI를 통해 로컬에서 생성 과정을 완전히 제어할 수 있으며, 하드웨어 구성부터 프롬프트 작성까지 모든 단계를 세밀하게 조정할 수 있습니다.

핵심 포인트 요약:

  1. 하드웨어 요구사항: RTX 3060 12GB는 최소 구성, RTX 4080 16GB 권장
  2. 설치 단계: ComfyUI 0.30.0+ → 모델 파일 다운로드 → 워크플로우 로드
  3. 세 가지 워크플로우: T2V(텍스트→비디오), I2V(이미지→비디오), R2V(레퍼런스→비디오)
  4. 성능 최적화: Sage Attention 활성화로 약 2배 속도 향상
  5. 프롬프트 팁: 장면, 샷, 오디오를 묘사하고 태그로 레퍼런스 자료 참조

이제 MiniMax H3 로컬 배포의 전체 과정을 마스터했습니다. AI 비디오 제작을 시작하세요!


📌 함께 읽으면 좋은 글: