MiniMaxAI/MiniMax-Music3
가사와 음악 설명을 바탕으로 최대 5분 길이의 완성형 음악 생성
가사와 구조화된 음악 설명으로 최대 5분 길이의 32 kHz stereo 음악을 생성하는 Hybrid-LM 모델
학습 방식 · Qwen3-8B에서 초기화한 8B Global LLM과 0.6B Local LLM을 공동 학습하고, 8층 RVQ tokenizer 및 Flow Matching·Flow-VAE 기반 연속 hidden-state 합성 모듈을 음악 생성에 맞게 훈련했습니다.
TL;DR
MiniMax Music 3는 LoRA나 양자화 파생 모델이 아닌 독립적인 open-weights 음악 생성 모델로, 가사와 구조화된 음악 설명을 입력받아 최대 5분의 완성곡을 만듭니다. Qwen3-8B에서 초기화한 8B Global LLM은 곡의 장거리 구조를 예측하고 0.6B Local LLM은 프레임 단위 음향을 채우는 Hybrid-LM 구조를 사용합니다. 두 모델의 연속 hidden state를 결합해 2.4B Flow Matching과 123M Flow-VAE Decoder로 합성하며 32 kHz stereo WAV를 출력합니다. SGLang-Omni, diffusers, ComfyUI에서 사용할 수 있지만 CUDA와 non-streaming 실행이 필요하고, 조건 입력이 결과의 tempo·key·편곡을 엄격히 보장하지는 않습니다.
핵심 포인트
- MiniMax Music 3는 가사와 상세한 음악 설명을 함께 받아 곡 전체의 구조와 보컬을 생성합니다. [Verse], [Chorus], [Bridge] 같은 구간 태그로 가사 흐름을 지정할 수 있습니다. 장르, BPM, 조성, 보컬, 악기, 편곡 진행을 한 프롬프트에 담아 세밀하게 제어합니다.
- 8B Global LLM과 0.6B Local LLM을 나눠 장거리 구조와 프레임 단위 음향을 처리합니다. Global LLM은 첫 번째 RVQ codebook으로 곡의 의미와 진행을 예측합니다. Local LLM은 나머지 일곱 개 acoustic codebook으로 보컬 발음과 악기 질감을 보완합니다.
- LLM의 연속 hidden state를 결합한 뒤 2.4B Flow Matching과 123M Flow-VAE Decoder를 거쳐 오디오를 합성합니다. 이 경로는 discrete RVQ token만 디코딩하는 대신 보컬의 articulation과 악기 texture에 필요한 음향 정보를 유지합니다. 최종 출력은 32 kHz, 16-bit stereo WAV입니다.
- 긴 곡을 처음부터 끝까지 생성하며 intro, verse, chorus, bridge, instrumental break, outro 같은 전개를 지원합니다. 최대 5분 동안 음악 테마, 리듬, 보컬 정체성, 편곡 진행을 유지하도록 설계됐습니다. 다만 요청한 tempo, key, instrumentation, lyrics, structure를 항상 정확히 보장하지는 않습니다.
제한사항
- CUDA가 필요하며 현재 non-streaming 생성만 지원합니다. text prompt는 5,000 tokens, 오디오 생성은 9,000 acoustic frames로 제한됩니다. 긴 곡과 정밀한 조건 제어를 사용하려면 이 입력 및 프레임 한도를 함께 고려해야 합니다.
- Section tag와 music description은 생성 방향을 제공하지만 symbolic guarantee는 아닙니다. 요청한 tempo, key, instrumentation, lyrics, song structure가 결과에 매번 정확히 반영되지는 않습니다. 따라서 정밀한 편곡 결과가 필요한 작업에서는 생성 후 결과 확인과 후처리가 필요합니다.
이미지 분석

272
Likes
25
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.