본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

multimodal-art-projection/YuE

Python0 / 0

가사와 스타일을 편집 가능한 악보로 바꾼 뒤 보컬 포함 곡을 생성하는 Python 음악 모델입니다.

TL;DR

이 레포지토리는 특정 음악 플랫폼의 플러그인이 아니라, Python API와 CLI를 제공하는 standalone 음악 생성 라이브러리·SDK이며 Hugging Face 모델을 내려받아 실행하는 연구용 도구에 가깝습니다. YuE2-3B는 가사와 스타일을 받아 melody·chord 계획을 ABC score로 만들고, AR–NAR Mixture-of-Transformers가 semantic token과 acoustic latent를 생성한 뒤 VAE가 48 kHz stereo audio로 복원합니다. score를 중간 산출물로 저장하므로 사람이 악보를 고치거나 yue2-music skill을 지원하는 agent가 harmony·melody·tempo·form을 조정할 수 있고, SheetSage2를 추가하면 녹음 기반 zero-shot cover도 처리합니다. 다만 Linux·Python 3.12·BF16 지원 NVIDIA GPU·24 GB VRAM이 필요하며, 편집 결과는 원본 waveform을 부분 보존하지 않고 새 녹음으로 다시 생성합니다.

핵심 포인트

  • Python 패키지와 CLI를 함께 제공하는 음악 생성 라이브러리·SDK로, Linux와 24 GB VRAM GPU 환경을 요구합니다.
  • YuE2-3B는 가사와 스타일을 melody·chord ABC score로 먼저 계획한 뒤 semantic token과 acoustic latent를 거쳐 48 kHz stereo audio를 생성합니다.
  • 생성된 score를 사람이 직접 수정하거나 agent skill로 harmony·melody·tempo·form을 바꾼 뒤 새 녹음을 만들 수 있습니다.
  • SheetSage2와 MERT2를 연결하면 녹음의 melody score 변환과 zero-shot cover를 지원하며, 원본 waveform은 편집 결과에 보존하지 않습니다.

벤치마크

벤치마크지표비교
WildSongBench YuE2 best-of-8SongBench Avg6.9632전체 평가 설정 중 최고 평균으로 기재됐지만, 최고 평균 간 격차는 통계적 유의성을 확정하지 않음
WildSongBench YuE2 best-of-8AudioBox PQ8.2714YuE2 표준 설정 8.2598보다 높지만 LeVo 2의 8.3966보다 낮음
WildSongBench YuE2 best-of-8MuLan0.5051Suno v5의 0.5428보다 낮고 YuE2 표준 설정의 0.5068보다 낮음
WildSongBench YuE2 best-of-8PER9.79%Suno v5의 8.10%와 Suno v4.5의 5.80%보다 높음
WildSongBench YuE2SongBench Avg6.7316Suno v5 6.8721과 Suno v5.5 6.7150 사이이며, YuE2 best-of-8 6.9632보다 낮음
Zero-shot cover evaluationCLEWS mAP0.647full-score 입력 기준이며, score 없이 생성할 때의 0.006보다 높음
MERT2 MARBLE최고 성능 지표 수15개 중 14개 SOTAMERT2 음악 이해 모델의 README 공개 수치이며 YuE2 생성 모델 자체의 점수가 아님
GTZANgenre accuracy91.72%MERT2의 공개 수치이며 YuE2 생성 모델 자체의 점수가 아님
SheetSage2 RWC-Popvocal melody pitch-class F182.51%SheetSage2 음원-악보 변환 모델의 공개 수치이며 YuE2 생성 모델 자체의 점수가 아님

이미지 분석

WildSongBench에서 곡 품질 지수와 가사 정렬 지수를 비교한 산점도이며, 원의 크기는 AudioBox production quality를 나타냅니다.
YuE2와 YuE2 (Bo8)는 Song quality index와 Text alignment index가 모두 높은 오른쪽 위 영역에 위치하고, Suno v5·v6 및 Mureka 9와 비교됩니다. 공개 표의 수치와 함께 보면 YuE2 best-of-8의 SongBench Avg 6.9632와 높은 정렬·품질 위치를 시각적으로 연결하지만, 그래프의 축은 정규화된 비교 지수이므로 절대 음질 점수로 해석하면 안 됩니다.
YuE2가 symbolic score에서 semantic token과 acoustic latent를 거쳐 VAE decoder로 stereo audio를 생성하는 처리 구조도입니다.
입력은 style·lyrics, 기존 녹음에서 변환한 score, 또는 편집한 ABC score이며, AR causal expert가 score와 semantic token을 순차 생성하고 NAR bidirectional expert가 flow-velocity 방식으로 acoustic latent를 예측합니다. 이후 VAE decoder가 48 kHz 오디오를 복원하며, 하단의 SheetSage2·MERT2·VAE encoder는 각각 학습용 score·token·latent target을 만드는 오프라인 구성요소로 배치돼 있습니다.

7.3k

STARS

820

FORKS

+193

TRENDING

0

조회수

watchers 7.3kopen issues 11Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.