본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

m-a-p/YuE2-3B

가사와 스타일 프롬프트를 음악으로 변환하고, ABC 악보 기반 작곡·cover·편집을 지원합니다.3Bcc-by-nc-4.0

가사·스타일과 ABC 악보를 바탕으로 보컬 음악을 만들고 수정하는 3B text-to-audio 모델

학습 방식 · 기반 모델과 별도의 훈련 방식은 README에 명시되지 않았으며, symbolic planning과 agentic editing을 결합한 text-to-audio 생성 pipeline으로 제공됩니다.

TL;DR

YuE2-3B는 가사와 스타일 프롬프트를 입력받아 보컬·반주가 포함된 완성곡을 만드는 open music generation 모델이며, 생성 과정에서 편집 가능한 ABC 악보를 함께 다룹니다. 하나의 AR–NAR Mixture-of-Transformers backbone이 악보와 semantic token을 작성한 뒤 flow matching으로 acoustic latent를 만들고, VAE가 이를 48 kHz stereo audio로 변환합니다. 기본 full 모드는 melody와 chord를 함께 계획하고, melody 모드는 cover 작업에 맞춰 멜로디 중심으로 처리하며, off 모드는 symbolic plan 없이 생성합니다. WildSongBench에서 YuE2의 SongBench Avg는 6.7316, best-of-8은 6.9632로 기록됐고, RTX 4090에서 3.6분 곡을 71초에 생성한 측정치가 제공됩니다.

핵심 포인트

  • ABC 악보에서 melody와 chord를 계획한 뒤 semantic token과 acoustic latent를 순차 생성해 보컬·반주가 포함된 곡으로 변환합니다.
  • style과 lyrics만 넣는 생성, 기존 melody ABC를 활용하는 cover, 편집한 score.abc를 다시 렌더링하는 작업을 하나의 pipeline에서 처리합니다.
  • WildSongBench SongBench Avg는 6.7316, best-of-8은 6.9632이며, best-of-8 수치는 192개 프롬프트에서 8개 후보를 선택한 결과입니다.
  • PyTorch·CUDA graphs·FlashAttention과 BF16 AR/NAR를 사용하며, RTX 4090 24GB에서 3.6분 곡 생성 시간은 71.04초로 측정됐습니다.

제한사항

  • 기본 실행에는 Linux, Python 3.10 이상, BF16을 지원하는 24GB NVIDIA GPU와 24GB의 사용 가능한 host RAM이 필요합니다.
  • HF 실행은 한 번에 한 곡을 처리하며, 생성 결과는 입력 방식과 VAE 선택에 따라 달라지고 YuE2-Vae는 지각 음질, YuE2-Vae-legacy는 벤치마크 musicality에서 각각 다른 장점을 보입니다.
  • 벤치마크 수치는 후보 선택 방식과 ASR pass 수를 포함한 특정 평가 프로토콜에 따른 결과이므로, 단일 생성 결과와 동일하게 해석하기 어렵습니다.

벤치마크

벤치마크지표비교
WildSongBench SongBench Avgaverage6.7316공개 모델 표에서 YuE2의 수치; Suno v5는 6.8721
WildSongBench SongBench Avgaverage, best-of-86.9632192개 프롬프트에서 8개 후보 중 선택한 YuE2 수치; Suno v5는 6.8721
WildSongBench Musicalityscore5.9075YuE2 표준 설정 수치; Suno v5는 5.9918
SHS100K CLEWS Hit@1percentage71.3%YuE2 full score 수치; SongEcho는 48.4%
RTX 4090 generationseconds for generation71.04초full CoT, 3.6분 곡, 32회 warm sample 평균

이미지 분석

WildSongBench 192개 프롬프트에서 Song quality index와 Text alignment index를 비교한 산점도입니다.
가로축은 Song quality index, 세로축은 Text alignment index이며, 점의 크기는 AudioBox PQ를 나타냅니다. YuE2와 YuE2 (Bo8)는 오른쪽 위 영역에 위치하고, YuE2 (Bo8)는 YuE2의 후보 8개 선택 설정으로 표시됩니다. 이는 symbolic planning을 사용하는 YuE2가 음악 품질과 텍스트 정렬을 함께 평가하는 비교 구도에서 Suno 계열 및 다른 모델과 나란히 측정됐음을 나타냅니다.
YuE2의 symbolic score·semantic token·acoustic latent 처리 흐름과 AR·NAR 전문가 구조를 나타낸 아키텍처 도식입니다.
입력 score는 AR expert의 causal token prediction으로 처리되고, semantic token은 NAR expert의 bidirectional flow-velocity prediction으로 acoustic latent로 변환됩니다. 두 경로는 hybrid self-attention과 FFN을 공유하며, VAE decoder가 latent를 48 kHz stereo audio로 복원합니다. 하단의 SheetSage2, MERT2 + CVQ, VAE encoder는 training audio에서 score·token·latent를 만드는 offline target builder로 배치돼 있습니다.

83

LIKES

81

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.