MiniMaxAI/MiniMax-H3
오픈 가중치 기반의 33B Omni Transformer로 768p 비디오와 네이티브 스테레오 오디오를 동기 생성하는 멀티모달 베이스 모델
학습 방식 · 공개 릴리스는 CFG-distilled 체크포인트 형태의 Omni Transformer 가중치를 포함하며, 사전학습 단계에서 멀티태스크·태스크 일반화 설계를 목표로 학습한 아키텍처 구성으로 배포됩니다. H3-Encoder는 Qwen3-VL-32B의 전체 프리트레인 가중치를 사용하여 50층의 히든 스테이트를 공급하고, H3-VisualVAE와 H3-AudioVAE는 재구성 품질과 생성 모델 학습 용이성을 모두 고려해 잠재 공간을 최적화한 뒤 ViT 기반 디코더로 디코딩 비용을 줄이는 추가 훈련을 거쳤습니다. 모델 내부에는 AdaLN 브랜치에 약 13B 규모의 파라미터가 존재하며 AdaLN 산출물을 캐시해 추론 비용을 낮출 수 있도록 설계되어 있고, 긴 시퀀스 비용 절감을 위해 최종 학습 단계에서는 native sparse attention을 도입했으나 sparse-attention 구현물은 초기 오픈소스 릴리스에 포함되지 않았습니다.
TL;DR
MiniMax H3는 33B 규모의 단일 스트림 Omni Transformer 기반 베이스 모델로, Qwen3-VL-32B를 텍스트 인코더로 재사용하고 시각·청각 잠재공간을 공동으로 생성하여 768p 비디오와 네이티브 32 kHz 스테레오 오디오를 동기화해 생성합니다. 공개된 배포는 FL2VA와 Ref2VA라는 두 가지 BF16 CFG-distilled 체크포인트 형태로 제공되며 diffusers 파이프라인에서 바로 로드해 768p 출력을 로컬에서 검증할 수 있고 2K 결과는 호스티드 H3-Context-IR 및 H3-Regenerate-2K API와 조합해 재현합니다. sparse-attention 등 장기 시퀀스 효율화는 문서상 계획되어 있으나 초기 릴리스에는 포함되지 않으므로 대규모 실서비스 배포 시 권장 프레임워크(SGLang, vLLM)와 다중 GPU 구성이 필요합니다.
핵심 포인트
- 모델 구조와 입력 처리 방식은 멀티모달 인코더·VAE·단일 스트림 Transformer로 통합되어 있습니다. 텍스트는 H3-Encoder(Qwen3-VL-32B 전체 가중치 사용)로 인코딩되고, 비주얼은 H3-Encoder와 H3-VisualVAE로, 오디오는 H3-AudioVAE로 각각 잠재 표현을 생성하여 하나의 packed sequence로 결합합니다. 이 결합된 시퀀스는 MM-RoPE(시간·높이·너비 3차원)와 RoPE 위치표현을 거쳐 H3-Omni-Transformer가 joint video-audio latents를 예측하는 방식으로 작동하여 시각과 청각을 동시 생성합니다.
- 배포 형태와 사용 가능한 체크포인트는 실용성에 초점을 맞추고 있습니다. 오픈소스로 공개된 것은 H3-Base의 두 태스크별 체크포인트(FL2VA, Ref2VA)로 BF16 정밀도를 사용하며 diffusers 파이프라인과 호환되도록 패키징되어 있습니다. H3-Context-IR와 H3-Regenerate-2K 모듈은 호스티드 서비스나 API 방식으로 제공되어, 로컬에서는 768p 출력 검증이 가능하고 2K 완성품 재현은 공식 API 연동으로 검증하는 권장 워크플로우를 제시합니다.
- 성능·출력 사양과 제한 조건은 명확하게 기술되어 있습니다. 생성 가능한 길이는 4~15초이며 기본 짧은 변(shorter side)은 768 픽셀로 설정되어 있고 프레임레이트는 24 FPS, 오디오는 32 kHz 스테레오를 지원합니다. 입력 제한은 모델 변형에 따라 다르며 Ref2VA는 최대 9개 이미지, 최대 3개 동영상(총합 ≤ 15초), 최대 3개 오디오(영상/이미지 동반) 등 구체적 규칙을 따릅니다.
제한사항
- 중요한 시스템 구성요소인 H3-Context-IR와 H3-Regenerate-2K는 초기 공개 릴리스에 포함되어 있지 않습니다. H3-Context-IR는 복수 단계의 호스티드 전처리·오케스트레이션 서비스로 동작하며 공식 API를 통해 동작을 재현하도록 설계되어 있어서, 로컬에서 동일한 품질을 얻으려면 개발자가 자체적인 컨텍스트 처리 파이프라인을 구현하거나 권장 프롬프트 가이드를 따라야 합니다. H3-Regenerate-2K 또한 내부적인 인컨텍스트 재생성 방식으로 고해상도 복원이 이루어지며 이 모듈의 코드와 체크포인트는 아직 공개되지 않았습니다.
- 초기 오픈소스 배포는 추론 시 full attention 모드만 제공되며 일부 효율화 기능이 누락되어 있습니다. 문서에 따르면 장기 멀티모달 시퀀스 비용을 줄이기 위한 sparse-attention은 추후 릴리스 예정으로 남아 있고, 실전 배포 권장 환경은 다수 GPU와 SGLang/vLLM 같은 서버 프레임워크를 전제로 합니다. 또한 라이선스가 'other' 유형의 MiniMax H3 Community License로 지정되어 있어 상업적·법적 사용 제한을 확인해야 하며 자동화된 안전 필터가 false positive/negative를 발생시킬 수 있다는 점도 고려해야 합니다.
이미지 분석


1.4k
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.