본문으로 건너뛰기

Qwen-Music: Melody-CoT와 25Hz Music Semantic Token으로 통합 텍스트→음악 및 커버 생성과 고품질 렌더링을 달성한 시스템

Qwen-Music은 25Hz Music Semantic Token과 Melody-CoT를 핵심으로 하는 LLM 기반 파이프라인과 DiT+Spec-VAE+Band-Mode Refiner 렌더러를 결합해 텍스트·가사·참조 멜로디에서 고음질 보컬 포함 완결곡을 생성하는 시스템이다.

용어 해설

음악 의미 토큰(Music Semantic Token)
오디오를 25 Hz 프레임 단위로 압축한 단일 코드북 정수 시퀀스로, 멜로디·하모니·악기 배치 등 음악적 의미를 보존하면서 시퀀스 길이를 줄여 autoregressive LLM이 전체 곡 구조를 예측하도록 하는 저비트레이트 이산 표현이다.
멜로디 체인오브쏘트(Melody-CoT)
생성 과정에서 먼저 낮은 프레임레이트의 멜로디 토큰(섹션 단위)을 계획한 뒤 전체 Music Semantic Token을 생성하도록 유도하는 중간 표현 기법으로, 멜로디 계획을 분리해 구조적 일관성과 참조 멜로디 복제 성능을 향상시킨다.
확산 Transformer(Diffusion Transformer (DiT))
조건화된 확산(디퓨전) 과정에서 연속적 오디오 latents를 예측하는 Transformer 기반 네트워크로, Music Semantic Tokens와 텍스트 조건을 cross-attention으로 받아 시간-주파수 공간의 연속적 표현을 생성하여 이후 VAE 디코더로 복원한다.
스펙트럼 VAE(Spec-VAE)
복소수 스펙트로그램을 25Hz 수준의 연속 latent로 압축·복원하는 VAE 구조로, 디퓨전이 예측한 latent를 복원해 복소수 STFT를 생성하며 이후 밴드별 정제기로 주파수 의존 잔차를 보정한다.
벡터 양자화 토크나이저(VQ Tokenizer)
Conformer 기반 인코더 활성화를 중간 레이어에서 32768개 코드북으로 양자화해 25Hz 단일 코드북 토큰 스트림을 생성하는 모듈로, 직렬화된 이산 토큰이 LLM의 입력·출력으로 사용되며 전체 비트레이트는 375 bit/s에 해당한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.