용어 해설
- 음악 의미 토큰(Music Semantic Token)
- — 오디오를 25 Hz 프레임 단위로 압축한 단일 코드북 정수 시퀀스로, 멜로디·하모니·악기 배치 등 음악적 의미를 보존하면서 시퀀스 길이를 줄여 autoregressive LLM이 전체 곡 구조를 예측하도록 하는 저비트레이트 이산 표현이다.
- 멜로디 체인오브쏘트(Melody-CoT)
- — 생성 과정에서 먼저 낮은 프레임레이트의 멜로디 토큰(섹션 단위)을 계획한 뒤 전체 Music Semantic Token을 생성하도록 유도하는 중간 표현 기법으로, 멜로디 계획을 분리해 구조적 일관성과 참조 멜로디 복제 성능을 향상시킨다.
- 확산 Transformer(Diffusion Transformer (DiT))
- — 조건화된 확산(디퓨전) 과정에서 연속적 오디오 latents를 예측하는 Transformer 기반 네트워크로, Music Semantic Tokens와 텍스트 조건을 cross-attention으로 받아 시간-주파수 공간의 연속적 표현을 생성하여 이후 VAE 디코더로 복원한다.
- 스펙트럼 VAE(Spec-VAE)
- — 복소수 스펙트로그램을 25Hz 수준의 연속 latent로 압축·복원하는 VAE 구조로, 디퓨전이 예측한 latent를 복원해 복소수 STFT를 생성하며 이후 밴드별 정제기로 주파수 의존 잔차를 보정한다.
- 벡터 양자화 토크나이저(VQ Tokenizer)
- — Conformer 기반 인코더 활성화를 중간 레이어에서 32768개 코드북으로 양자화해 25Hz 단일 코드북 토큰 스트림을 생성하는 모듈로, 직렬화된 이산 토큰이 LLM의 입력·출력으로 사용되며 전체 비트레이트는 375 bit/s에 해당한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




