TL;DR
Qwen-Music은 긴 범위 음악 구성(가사, 멜로디, 섹션 구조)과 파형 수준의 세부 음향(주파수별 위상·크기·스테레오)을 분리해 각각 최적화함으로써 기존 토큰 기반 음악 생성에서 손실되기 쉬운 음향 세부를 복원 가능한 실무적 파이프라인을 제시합니다. 25Hz 단일 코드북 토큰으로 시퀀스 길이를 관리하면서 Melody-CoT로 멜로디 계획을 명시적으로 넣어 참조 멜로디 복제와 스타일 전환을 동시에 달성한 점이 핵심입니다. 이 구조는 대규모 데이터에서 품질 등급별 커리큘럼과 단계적 선호도 정렬(DPO→GSPO)을 결합해 실음향 품질과 제어성을 함께 끌어올린 실험적 근거를 제공합니다.
왜 중요한가
Qwen-Music은 긴 범위 음악 구성(가사, 멜로디, 섹션 구조)과 파형 수준의 세부 음향(주파수별 위상·크기·스테레오)을 분리해 각각 최적화함으로써 기존 토큰 기반 음악 생성에서 손실되기 쉬운 음향 세부를 복원 가능한 실무적 파이프라인을 제시합니다. 25Hz 단일 코드북 토큰으로 시퀀스 길이를 관리하면서 Melody-CoT로 멜로디 계획을 명시적으로 넣어 참조 멜로디 복제와 스타일 전환을 동시에 달성한 점이 핵심입니다. 이 구조는 대규모 데이터에서 품질 등급별 커리큘럼과 단계적 선호도 정렬(DPO→GSPO)을 결합해 실음향 품질과 제어성을 함께 끌어올린 실험적 근거를 제공합니다.
핵심 기여
25Hz 단일 코드북 Music Semantic Token을 통한 저비트레이트 의미 표현
Conformer 기반 토크나이저를 네 단계( BestRQ → 인과 적응 → 멀티태스크 SFT → VQ)로 학습해 각 40ms 프레임을 0∼32768 정수로 매핑하는 25Hz 단일 코드북 스트림을 도입했고, 이로써 전체 곡 수준의 의미적 시퀀스를 LLM으로 효율적으로 모델링할 수 있었습니다.
멜로디-토큰 기반 Chain-of-Thought(Melody-CoT)로 명시적 멜로디 계획 도입
RMVPE로 추출한 50Hz 피치 곡선을 8× median-pool해 6.25Hz 멜로디 토큰으로 변환하고, 섹션 단위 멜로디 계획을 먼저 생성한 뒤 전체 Music Semantic Token을 생성하게 하여 구조적 일관성과 참조 멜로디 복제 성능을 개선했습니다.
DiT + Spec-VAE + Band-Mode Refiner로 구성된 생성적 스테레오 렌더러
LLM이 예측한 토큰을 조건으로 1.3B DiT가 연속 latents를 예측하고 Spec-VAE가 복소 스펙트럼을 복원한 뒤 주파수대별 phase·magnitude 보정을 하는 Band-Mode Refiner로 48kHz 스테레오 파형을 생성해 렌더링 품질을 확보했습니다.
품질 등급화된 사전학습 커리큘럼과 다단계 선호도 정렬 파이프라인
5M 시간 이상의 다국어 음악 데이터에서 장르별 MOS 기반 분포로 Q1–Q6 버킷을 구성해 단계적으로 학습했으며, Supervised→DPO(오프라인)→GSPO(온라인) 순서의 포스트트레이닝으로 음악성·지시순응성을 향상시켰습니다.
광범위한 객관·주관 평가에서의 우수성
전문가 A/B 선호도 테스트와 SongBench/SongEval/AudioBox-Aesthetic 지표에서 다수 항목의 최고 성능을 보고했으며, 외부 리더보드에서 'JazzCat'으로 상위권에 랭크된 실증 결과를 제시했습니다.
핵심 아이디어 이해하기
음악 생성 과제는 가사·멜로디·반복구조 등 긴 시퀀스 수준의 의미적 구성과 파형 수준의 시간·주파수적 세부 재현이라는 서로 다른 두 수준의 요구를 동시에 만족해야 합니다. 기존의 이산 토큰 LLM 접근은 곡 전체 구조를 다루는 데 유리하지만 압축 과정에서 고주파·위상·스테레오 정보가 손실되어 음질 저하가 발생했습니다. Qwen-Music은 이 문제를 해결하기 위해 의미적 구성은 낮은 프레임레이트의 이산 토큰으로, 음향적 재현은 연속적 latents와 스펙트럼 디코더로 분리하여 각 문제를 전용 서브시스템으로 최적화하는 설계를 채택했습니다.
방법론
토크나이저는 24-layer Conformer 백본을 공유하고 네 단계 학습(BestRQ 기반 양방향 자기지도 → 인과 적응 → 멀티태스크 SFT(CTC, Mel, chroma) → VQ 삽입)으로 연속 표현을 먼저 학습한 뒤 양자화를 도입해 안정적으로 25Hz 토큰을 얻었습니다. Qwen-Music-LLM은 3B급 Qwen3.5-Omni 계열 초기화체를 사용해 텍스트·가사·멜로디 토큰을 조건으로 autoregressive하게 Music Semantic Tokens를 생성하며, Melody-CoT 패턴을 섞어 멜로디 계획과 전체 토큰 생성을 동시에 학습합니다. 렌더러는 조건화된 Diffusion Transformer가 연속 latents를 생성하고 Spec-VAE가 복소 스펙트럼을 복원한 뒤 Band-Mode Refiner가 저중(phase)·중대·고대역(주파수별) 보정을 수행하여 최종 inverse STFT로 48kHz 스테레오를 합성하는 3단계 워크플로우를 따릅니다.
관련 Figure

이 다이어그램은 사용자의 자연어 조건이 구조화된 태그와 가사로 재작성된 뒤 Melody-CoT와 Music Semantic Tokens로 변환되어 LLM이 시퀀스를 생성하고 렌더러가 오디오를 합성하는 전체 파이프라인을 한눈에 보여줍니다. 구성요소별 입출력(프롬프트 토큰, 멜로디 토큰, 음악 의미 토큰, 렌더 출력)의 흐름을 명확히 하여 본문의 방법론 서술을 시각적으로 보강합니다.
시스템 아키텍처 다이어그램으로 Prompt Rewriter, Melody Tokenizer, Qwen-Music-LLM, Qwen-Music-Render의 데이터 흐름을 그림으로 나타내고 있습니다.

이 그림은 토크나이저가 양방향 자기지도(BestRQ)로 표현을 학습한 뒤 인과화, 다중 감독(CTC·Mel·chroma), 마지막으로 VQ 삽입을 통해 양자화된 토큰 스트림을 얻는 순서를 보여주며 각 단계의 목적과 학습 목표 차이를 직관적으로 전달합니다. 특히 VQ 삽입 전후의 상이한 손실 함수와 입력 마스킹 정책을 연계해 토크나이저의 안정적 구축 절차를 뒷받침합니다.
Qwen-Music-Tokenizer의 네 단계 학습(최적화 흐름)을 나타내는 도식으로 BestRQ, causal adaptation, multi-task SFT, VQ 단계를 보여줍니다.
주요 결과
전문가 A/B 맹검 평가에서 Qwen-Music은 MiniMax Music 2.5+, MiniMax Music 2.6, Mureka V8, Suno V5 대비 평균 우위를 보였고 Suno V5.5와는 근소한 차이로 동등한 수준을 기록했습니다. 객관평가에서는 SongBench·SongEval·AudioBox-Aesthetic의 16개 지표 중 13개에서 최상위를 차지했으며, 가사 인식 PER와 태그 따름 성능에서도 경쟁력 있는 수치를 얻었습니다. 커버 생성 실험에서는 section-level 멜로디 조건이 Melody MAE를 최소화해 멜로디 복제를 강화했고 unique-section 모드는 태그 따름과 음악성 측면에서 우월한 균형을 보였습니다.
관련 Figure

그래프는 Qwen-Music이 MiniMax 2.5+, MiniMax 2.6, Mureka V8, Suno V5에 대해 각각 59.1%, 66.7%, 58.3%, 55.4%의 승률을 기록했고 Suno V5.5와는 50.3% 대 49.7%로 거의 동등한 결과를 보인 점을 시각적으로 요약합니다. 이 수치는 논문 본문에서 보고된 맹검 선호 실험의 집계 결과와 일치하며, 모델 비교에서의 상대적 우위와 근접 경쟁 관계를 한눈에 보여줍니다.
전문가 A/B 선호도 막대그래프를 통해 Qwen-Music이 여러 상용 시스템 대비 선호 비율을 보고하고 있습니다.

리더보드 표는 시스템별 Elo, 신뢰구간, 샘플 수 등 비교 지표를 제시하며 Qwen-Music(=JazzCat)의 순위와 타사 모델의 근접 순위를 외부 벤치마크 관점에서 검증합니다. 이 이미지는 본문에서 주장하는 외부 리더보드 상위권 근거를 직접 보완하며 인간 평가와 자동평가 외부 지표의 일관성을 지원합니다.
Artificial Analysis 리더보드 스크린샷으로 Qwen-Music이 JazzCat 명칭으로 상위권에 랭크된 순위를 보여줍니다.
기술 상세
Qwen-Music-Tokenizer는 입력을 24kHz 단일 채널로 변환한 후 log-Mel을 계산하고 컨볼루션 프론트엔드로 25Hz 프레임률을 얻어 Conformer(24 layer, width 1024, 16 heads)로 인코딩합니다. Stage4에서 삽입되는 VQ는 32768개 항목을 가지며 cosine metric과 straight-through estimator로 학습되어 토큰 활용률이 99% 이상에 도달하고 최종 비트레이트는 375 bit/s가 됩니다. Melody Tokenizer는 RMVPE로 얻은 50Hz 피치를 8배 median-pool해 6.25Hz 시퀀스로 만들고 전역 MIDI 중앙값을 빼서 상대음정 오프셋을 256-어휘로 인코딩하여 성능상 절대 음정 정보 유출을 차단합니다.
관련 Figure

그림은 DiT가 noisy latent를 예측하고 Spec-VAE가 이를 복소 스펙트럼으로 복원한 뒤 Band-Mode Refiner가 주파수대별 magnitude·phase 수정을 수행해 최종 iSTFT로 48kHz 스테레오를 합성하는 처리 흐름을 시각화합니다. 각 구성요소의 입력·출력 형태와 주어진 해상도(프레임레이트, latent 차원 등)를 함께 제시해 렌더링 파이프라인의 설계 의도를 명확히 합니다.
렌더러 구조 다이어그램과 Spec-VAE, DiT, Band-Mode Refiner의 상호작용을 보여주는 도식입니다.
키워드
용어 해설
- Music Semantic Token
- — 오디오를 25 Hz 프레임 단위로 압축한 단일 코드북 정수 시퀀스로, 멜로디·하모니·악기 배치 등 음악적 의미를 보존하면서 시퀀스 길이를 줄여 autoregressive LLM이 전체 곡 구조를 예측하도록 하는 저비트레이트 이산 표현이다.
- Melody-CoT
- — 생성 과정에서 먼저 낮은 프레임레이트의 멜로디 토큰(섹션 단위)을 계획한 뒤 전체 Music Semantic Token을 생성하도록 유도하는 중간 표현 기법으로, 멜로디 계획을 분리해 구조적 일관성과 참조 멜로디 복제 성능을 향상시킨다.
- Diffusion Transformer (DiT)
- — 조건화된 확산(디퓨전) 과정에서 연속적 오디오 latents를 예측하는 Transformer 기반 네트워크로, Music Semantic Tokens와 텍스트 조건을 cross-attention으로 받아 시간-주파수 공간의 연속적 표현을 생성하여 이후 VAE 디코더로 복원한다.
- Spec-VAE
- — 복소수 스펙트로그램을 25Hz 수준의 연속 latent로 압축·복원하는 VAE 구조로, 디퓨전이 예측한 latent를 복원해 복소수 STFT를 생성하며 이후 밴드별 정제기로 주파수 의존 잔차를 보정한다.
- VQ Tokenizer
- — Conformer 기반 인코더 활성화를 중간 레이어에서 32768개 코드북으로 양자화해 25Hz 단일 코드북 토큰 스트림을 생성하는 모듈로, 직렬화된 이산 토큰이 LLM의 입력·출력으로 사용되며 전체 비트레이트는 375 bit/s에 해당한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.