m-a-p/YuE2-3B
가사와 스타일 프롬프트를 음악으로 변환하고, ABC 악보 기반 작곡·cover·편집을 지원합니다.3Bcc-by-nc-4.0
가사·스타일과 ABC 악보를 바탕으로 보컬 음악을 만들고 수정하는 3B text-to-audio 모델
학습 방식 · 기반 모델과 별도의 훈련 방식은 README에 명시되지 않았으며, symbolic planning과 agentic editing을 결합한 text-to-audio 생성 pipeline으로 제공됩니다.
TL;DR
YuE2-3B는 가사와 스타일 프롬프트를 입력받아 보컬·반주가 포함된 완성곡을 만드는 open music generation 모델이며, 생성 과정에서 편집 가능한 ABC 악보를 함께 다룹니다. 하나의 AR–NAR Mixture-of-Transformers backbone이 악보와 semantic token을 작성한 뒤 flow matching으로 acoustic latent를 만들고, VAE가 이를 48 kHz stereo audio로 변환합니다. 기본 full 모드는 melody와 chord를 함께 계획하고, melody 모드는 cover 작업에 맞춰 멜로디 중심으로 처리하며, off 모드는 symbolic plan 없이 생성합니다. WildSongBench에서 YuE2의 SongBench Avg는 6.7316, best-of-8은 6.9632로 기록됐고, RTX 4090에서 3.6분 곡을 71초에 생성한 측정치가 제공됩니다.
핵심 포인트
- ABC 악보에서 melody와 chord를 계획한 뒤 semantic token과 acoustic latent를 순차 생성해 보컬·반주가 포함된 곡으로 변환합니다.
- style과 lyrics만 넣는 생성, 기존 melody ABC를 활용하는 cover, 편집한 score.abc를 다시 렌더링하는 작업을 하나의 pipeline에서 처리합니다.
- WildSongBench SongBench Avg는 6.7316, best-of-8은 6.9632이며, best-of-8 수치는 192개 프롬프트에서 8개 후보를 선택한 결과입니다.
- PyTorch·CUDA graphs·FlashAttention과 BF16 AR/NAR를 사용하며, RTX 4090 24GB에서 3.6분 곡 생성 시간은 71.04초로 측정됐습니다.
제한사항
- 기본 실행에는 Linux, Python 3.10 이상, BF16을 지원하는 24GB NVIDIA GPU와 24GB의 사용 가능한 host RAM이 필요합니다.
- HF 실행은 한 번에 한 곡을 처리하며, 생성 결과는 입력 방식과 VAE 선택에 따라 달라지고 YuE2-Vae는 지각 음질, YuE2-Vae-legacy는 벤치마크 musicality에서 각각 다른 장점을 보입니다.
- 벤치마크 수치는 후보 선택 방식과 ASR pass 수를 포함한 특정 평가 프로토콜에 따른 결과이므로, 단일 생성 결과와 동일하게 해석하기 어렵습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| WildSongBench SongBench Avg | average | 6.7316 | 공개 모델 표에서 YuE2의 수치; Suno v5는 6.8721 |
| WildSongBench SongBench Avg | average, best-of-8 | 6.9632 | 192개 프롬프트에서 8개 후보 중 선택한 YuE2 수치; Suno v5는 6.8721 |
| WildSongBench Musicality | score | 5.9075 | YuE2 표준 설정 수치; Suno v5는 5.9918 |
| SHS100K CLEWS Hit@1 | percentage | 71.3% | YuE2 full score 수치; SongEcho는 48.4% |
| RTX 4090 generation | seconds for generation | 71.04초 | full CoT, 3.6분 곡, 32회 warm sample 평균 |
이미지 분석


83
LIKES
81
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.