MuScriptor/muscriptor-large
MuScriptor large는 5초 멜 스펙트로그램을 prefix로 사용한 decoder-only Transformer로 다중 악기 오디오를 MIDI-like 이벤트로 전사하며 D_Test에서 Onset F1 60.4, Frame F1 72.4를 기록했다.
학습 방식 · 기본적으로 MT3 계열의 시퀀스-투-시퀀스 전사 레시피를 확장해 합성 데이터(D_Synth), 실음원(D_Real), 그리고 RL 기반 추가 학습(D_RL)을 결합한 풀 파이프라인으로 학습시켰다. 이 혼합 데이터 파이프라인은 합성 프리트레이닝으로 음고·환경 다양성을 보강하고 실제 음원으로 미세조정한 뒤 RL 요소로 출력 일관성을 추가로 튜닝하는 방식으로 설계되었다. 학습 과정에서는 동일한 토크나이저와 입력 파이프라인을 모든 모델 변형에 일관되게 적용했다.
TL;DR
MuScriptor large는 Mirelo와 Kyutai 공동 연구로 개발된 약 1.3B 파라미터 규모의 다중 악기 자동 음악 전사 모델로서 5초 멜 스펙트로그램을 prefix로 사용하는 decoder-only Transformer 구조를 채택했다. 출력은 MT3 유사 토큰 시퀀스로 온셋·오프셋·피치·악기 정보를 제공하며 벨로시티 복원과 동일 피치·동일 악기 동시발음 표현은 불가능하다. instrument conditioning과 CFG 옵션을 통해 악기 할당과 조건 제어를 적용할 수 있으며 풀 파이프라인(D_Synth + D_Real + D_RL) 기준 D_Test에서 Onset F1 60.4, Frame F1 72.4, Offset F1 48.6, Multi F1 47.8을 기록해 제시된 baseline 대비 실측상 우위를 보였다. 다만 학습 데이터 분포는 팝·서구 클래식에 편향되어 있고 악기 세분화는 MT3_FULL_PLUS 36그룹으로 제한되어 일부 희귀 악기와 스타일에서 성능 한계가 존재한다.
핵심 포인트
- 디코더 전용 Transformer와 단일 입력 파이프라인으로 구성해 설계가 단순하고 추론 통합이 용이하다.
- MT3 유사 토크나이저를 사용해 MIDI-like 이벤트를 직접 생성하며 36개 악기 그룹으로 악기 범주를 압축해 악기 할당을 실무적으로 단순화했다.
- instrument conditioning으로 악기 존재 정보를 조건으로 제공해 청크 경계에서의 악기 일관성을 개선하는 기능을 제공한다.
- 합성 데이터, 실제 데이터, 그리고 RL 요소를 결합한 풀 파이프라인 학습으로 다양한 데이터 분포에 대응하도록 설계되었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| D_Test (authors' held-out test set) | Onset F1 | 60.4% | vs YourMT3+ baseline 32.5% |
| D_Test (authors' held-out test set) | Frame F1 | 72.4% | vs YourMT3+ baseline 45.5% |
| D_Test (authors' held-out test set) | Offset F1 | 48.6% | vs YourMT3+ baseline 17.8% |
| D_Test (authors' held-out test set) | Drums F1 | 49.6% | vs YourMT3+ baseline 41.4% |
| D_Test (authors' held-out test set) | Multi F1 | 47.8% | vs YourMT3+ baseline 21.9% |
79
LIKES
1.4k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.