본문으로 건너뛰기

MuScriptor: 멀티악기 음악 전사를 위한 오픈 모델

MuScriptor는 1.3B 규모의 decoder-only Transformer를 기반으로 합성 MIDI 프리트레이닝, 11k시간 규모 실제 녹음 파인튜닝, 그리고 GRPO 유사 강화학습 후처리를 결합하여 다중 악기 전사 성능을 크게 개선한 오픈 웨이트 모델이다.

용어 해설

멜-스펙트로그램(Mel-spectrogram)
원음 신호를 짧은 시간 프레임으로 나누어 STFT를 수행한 뒤 주파수 축을 멜 스케일로 재배치한 표현이다. 이 논문에서는 16 kHz 모노 파형에 STFT nFFT=2048과 hop=160 샘플을 적용해 100Hz 프레임레이트와 512 멜 빈을 생성하며, 모델 입력으로 사용되어 음높이·시간 정보를 모델에 전달한다.
분류기-프리 가이던스(Classifier-Free Guidance)
모델에 조건을 주는 방식에서 조건을 무작위로 제거한 예시를 섞어 학습·추론 시 조건 유무의 차이를 활용해 샘플을 조정하는 기법이다. MuScriptor는 악기 조건과 스펙트로그램 조건에 대해 αCFG=2를 적용해 조건성 향상과 불안정성 완화를 동시에 달성했다.
동적 시간 왜곡(Dynamic Time Warping)
두 시계열 간 비선형 시간 정렬을 찾는 알고리즘으로, 본 논문에서는 크로마와 온셋 특징을 사용해 악보와 오디오 간 정렬을 보정하고 품질이 낮은 매칭을 필터링하는 데 사용되었다. 정렬 품질 기준과 최대 시간 왜곡 비율을 적용해 실음원 데이터의 동기화를 확보했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.