다중 악기 자동 전사 최고 품질 체크포인트, MuScriptor large 공개
MuScriptor large는 5초 멜 스펙트로그램을 prefix로 사용한 decoder-only Transformer로 다중 악기 오디오를 MIDI-like 이벤트로 전사하며 D_Test에서 Onset F1 60.4, Frame F1 72.4를 기록했다.
TL;DR
MuScriptor large는 Mirelo와 Kyutai 공동 연구로 개발된 약 1.3B 파라미터 규모의 다중 악기 자동 음악 전사 모델로서 5초 멜 스펙트로그램을 prefix로 사용하는 decoder-only Transformer 구조를 채택했다. 출력은 MT3 유사 토큰 시퀀스로 온셋·오프셋·피치·악기 정보를 제공하며 벨로시티 복원과 동일 피치·동일 악기 동시발음 표현은 불가능하다. instrument conditioning과 CFG 옵션을 통해 악기 할당과 조건 제어를 적용할 수 있으며 풀 파이프라인(D_Synth + D_Real + D_RL) 기준 D_Test에서 Onset F1 60.4, Frame F1 72.4, Offset F1 48.6, Multi F1 47.8을 기록해 제시된 baseline 대비 실측상 우위를 보였다. 다만 학습 데이터 분포는 팝·서구 클래식에 편향되어 있고 악기 세분화는 MT3_FULL_PLUS 36그룹으로 제한되어 일부 희귀 악기와 스타일에서 성능 한계가 존재한다.
핵심 역량
- 다중 악기 혼합물에서 음의 온셋과 프레임, 오프셋을 토큰화된 이벤트 시퀀스로 변환할 수 있다. 이 과정은 5초 청크 단위의 멜 스펙트로그램을 prefix로 입력하고 디코더가 autoregressive 방식으로 이벤트를 생성하는 방식으로 작동한다. 출력은 시간 순서대로 노트 이벤트를 방출하며 MIDI 파일로 직접 저장하거나 스트리밍 이벤트로 소비할 수 있다.
- 악기 컨디셔닝을 통해 특정 악기 그룹의 존재를 명시적으로 주입할 수 있으며 이를 통해 세그먼트 경계에서의 악기 할당 일관성을 높일 수 있다. instrument_group 인자는 MT3_FULL_PLUS 36개 그룹의 아이디 문자열로 전달되어 추론 시 조건으로 사용된다. 이 입력은 분리하기 어려운 혼합물에서 악기 태깅 오류를 줄이는 데 기여한다.
- 디코딩은 기본적으로 greedy(argmax)로 동작하며 선택적으로 classifier-free guidance(CFG)를 적용해 조건 신호의 영향력을 조절할 수 있다. CFG 적용 시 조건부와 무조건부 출력을 가중합해 출력 방향을 바꿀 수 있으므로 악기 제약이나 일관성 요구가 높은 작업에 유용하다. 스트리밍 추론은 각 청크에서 생성된 노트 이벤트를 시간 순으로 병합해 연속 트랙을 생성한다.
강점
- D_Test 풀 파이프라인 기준 Onset F1 60.4 및 Frame F1 72.4를 기록해 제시된 YourMT3+ baseline의 Onset F1 32.5 및 Frame F1 45.5에 비해 실측상 우위를 보였다. 이러한 수치 차이는 동일 데이터셋 비교에서 대형 모델의 성능 우수성을 뒷받침한다.
- 모델 계열로 small·medium·large를 제공해 성능과 속도 간 트레이드오프 선택이 가능하며 동일 토크나이저와 학습 레시피를 공유하므로 파이프라인 통합이 용이하다. 또한 공개된 체크포인트와 muscriptor 라이브러리를 통해 로컬 추론 및 파이프라인 통합이 즉시 가능하다.
훈련 방식
기본적으로 MT3 계열의 시퀀스-투-시퀀스 전사 레시피를 확장해 합성 데이터(D_Synth), 실음원(D_Real), 그리고 RL 기반 추가 학습(D_RL)을 결합한 풀 파이프라인으로 학습시켰다. 이 혼합 데이터 파이프라인은 합성 프리트레이닝으로 음고·환경 다양성을 보강하고 실제 음원으로 미세조정한 뒤 RL 요소로 출력 일관성을 추가로 튜닝하는 방식으로 설계되었다. 학습 과정에서는 동일한 토크나이저와 입력 파이프라인을 모든 모델 변형에 일관되게 적용했다.
알아두면 좋은 것
- MuScriptor는 decoder-only Transformer(dim=1536, heads=24, layers=48) 아키텍처를 사용하며 입력은 5초 구간의 멜 스펙트로그램이다. 스펙트로그램은 STFT n_fft=2048, hop=160으로 계산되어 100 Hz 프레임 레이트와 512 멜 빈을 생성하고 이 표현을 모델의 prefix 조건으로 투사한다. 이 단순한 구조 선택은 복잡한 아키텍처 변화 없이도 강력한 전사 품질을 얻기 위한 설계적 판단이다.
- 토크나이저는 MT3 유사 이벤트를 사용해 온셋/오프셋 타이밍, 피치, 악기 그룹을 복원하지만 벨로시티는 복원하지 못하며 동일 피치·동일 악기 동시발음은 표현할 수 없다. 128 MIDI 프로그램을 MT3_FULL_PLUS 분류법으로 36개 악기 하위그룹으로 매핑해 악기 범주를 단순화하고 실제 분포에 맞춘 조건 입력을 허용한다. 이 표현적 제약은 일부 복잡한 합주나 드럼 부분에서 성능 한계를 유발할 수 있다.
- 평가에서 1.3B 풀 파이프라인(D_Synth + D_Real + D_RL, CFG=2) 기준으로 Onset F1 60.4, Frame F1 72.4, Offset F1 48.6, Multi F1 47.8을 기록해 제공된 baseline(YourMT3+) 대비 큰 폭의 성능 향상을 보였다. 모델 변형으로는 small(≈100M), medium(≈300M), large(≈1.3B)이 존재하며 동일한 입력·토크나이저·학습 레시피를 공유한다. 라이선스는 CC BY-NC 4.0으로 연구 및 비상업적 사용을 전제로 하며 특정 사용 제한이 README에 명시되어 있다.
기술적 특징
- 아키텍처는 decoder-only Transformer로 구성되어 있으며 large 변형은 dim=1536, num_heads=24, num_layers=48의 하이퍼파라미터를 사용한다. 이 구조는 입력 스펙트로그램을 prefix로 투사하고 디코더가 autoregressive하게 노트 이벤트를 생성하는 방식으로 동작하며 복잡한 인코더-디코더 구조를 배제해 구현 복잡도를 낮췄다. 단순한 구조 선택은 추론 효율성과 모델 확장성을 고려한 설계 결정이다.
- 입력 파이프라인은 5초 단위의 원시 파형을 16 kHz로 리샘플링한 뒤 STFT n_fft=2048, hop=160으로 계산해 100 Hz 프레임 레이트와 512 멜 빈의 멜 스펙트로그램을 만든다. 이 멜 스펙트로그램은 모델의 prefix 조건으로 사용되며 스펙트로그램을 모델 차원으로 투사한 값이 디코더의 초기 조건 역할을 수행한다. 이렇게 짧은 청크 단위 처리와 시간 분해능 설정은 실시간 스트리밍 추론과 타이밍 정밀도 사이 균형을 맞추는 의도적 선택이다.
- 출력 토크나이저는 MT3 유사 이벤트를 사용해 온셋·오프셋·피치·악기를 이벤트로 인코딩하며 128 MIDI 프로그램을 MT3_FULL_PLUS 분류법에 따라 36개 악기 그룹으로 매핑한다. 이 토크나이저는 벨로시티를 복원하지 못하고 동일 피치·동일 악기 동시발음을 표현할 수 없는 설계적 제약을 가지며 드럼은 온셋 정보만을 포함한다. 이러한 표현 제약은 모델이 단순하고 일관된 이벤트 시퀀스를 생성하는 데 유리하지만 일부 음악적 디테일을 손실할 수 있다.
- 추론 파이프라인은 오디오를 5초 청크로 분할해 각 청크를 순차 처리하고 생성된 노트 이벤트를 시간 순서대로 방출하는 스트리밍 방식을 사용한다. 추가로 instrument conditioning 입력을 받아 특정 악기 그룹의 존재를 명시하면 세그먼트 경계에서의 악기 할당이 안정화되고 정량 성능이 개선된다고 보고되었다. 디코딩은 기본적으로 greedy(argmax)이며 필요시 classifier-free guidance(CFG)를 적용해 조건 신호의 영향력을 조절할 수 있다.
차별점
- 디코더 전용 Transformer와 단일 입력 파이프라인으로 구성해 설계가 단순하고 추론 통합이 용이하다.
- MT3 유사 토크나이저를 사용해 MIDI-like 이벤트를 직접 생성하며 36개 악기 그룹으로 악기 범주를 압축해 악기 할당을 실무적으로 단순화했다.
- instrument conditioning으로 악기 존재 정보를 조건으로 제공해 청크 경계에서의 악기 일관성을 개선하는 기능을 제공한다.
- 합성 데이터, 실제 데이터, 그리고 RL 요소를 결합한 풀 파이프라인 학습으로 다양한 데이터 분포에 대응하도록 설계되었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| D_Test (authors' held-out test set) | Onset F1 | 60.4% | vs YourMT3+ baseline 32.5% |
| D_Test (authors' held-out test set) | Frame F1 | 72.4% | vs YourMT3+ baseline 45.5% |
| D_Test (authors' held-out test set) | Offset F1 | 48.6% | vs YourMT3+ baseline 17.8% |
| D_Test (authors' held-out test set) | Drums F1 | 49.6% | vs YourMT3+ baseline 41.4% |
| D_Test (authors' held-out test set) | Multi F1 | 47.8% | vs YourMT3+ baseline 21.9% |
79
Likes
1.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.