본문으로 건너뛰기

WanSong v1.0: 연속 토큰 기반 순수 확산 프레임워크를 통한 장편 고음질 텍스트-투-뮤직 생성

WanSong v1.0은 연속 오디오 토큰을 단일 확산 백본으로 직접 생성해 최대 5분 길이의 다국어 노래를 보컬과 BGM 분리 스템으로 한 번에 출력하고 VAE 1024 압축률과 RLHF로 품질을 개선했다.

용어 해설

노이즈 제거 확산 모델(Denoising Diffusion)
시간축에서 점진적으로 노이즈를 더한 뒤 이를 역으로 제거해 고품질 데이터를 생성하는 확률적 생성 방식으로, 본문에서는 오디오 잠재공간에서 연속 토큰을 직접 생성하는 단일 단계 파이프라인 구현에 핵심적인 학습 및 샘플링 메커니즘으로 사용되었다.
듀얼 스템 토큰(Dual-stem token)
보컬과 배경음악(BGM)을 서로 간섭하지 않도록 분리해 각각 독립적으로 예측하도록 설계한 연속 토큰 표현으로, 모델 출력에서 보컬·BGM을 따로 생성해 음원 후처리와 편집을 용이하게 하고 CFG로 발생한 음성·반주 균형 문제를 완화하는 역할을 한다.
플로우 매칭(Flow Matching)
확산 모델 학습에서 노이즈-치유 역과정을 연속적인 속도(velocity) 예측 관점으로 정식화하여 중간 시점의 속도 값을 추정하도록 하는 방법으로, 본문에서는 오디오 잠재공간의 denoising diffusion을 학습하는 핵심 손실 설계로 사용되었다.
VAE 압축률(VAE Compression Ratio)
원시 스테레오 파형을 잠재 텐서로 변환할 때 시간/채널 차원을 줄이는 비율로, 본문에서는 2048과 1024 두 설정을 비교해 압축률이 낮을수록 시간-주파수 세부 재현이 개선된다는 실험적 근거를 제시했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.