본문으로 건너뛰기
Samsung Research조회 1

MusicJudge로 가사와 음악을 함께 평가하는 노래 심사

MusicJudge는 가사·음정·리듬을 음악적 블록 단위로 결합해 인간 심사 순위와 0.683의 상관을 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

MusicJudge는 노래 평가를 가사 정확성과 음정·리듬 충실도를 함께 측정하는 문제로 재구성하고, verse·chorus·bridge·alaap 같은 음악적 블록 단위로 점수를 계산합니다. Whisper 기반 전사 모델에는 MG-LoRA를 적용해 지속음의 길이와 음정 구간, vocal onset을 학습 목표에 반영했으며, 가사 블록은 semantic embedding·fuzzy lexical·phonetic 신호를 결합해 찾습니다. 120개 보컬 공연에서 인간 전문가 순위와 Spearman 상관계수 0.683을 기록했고, MG-LoRA는 세 데이터셋 평균 전사 정확도를 차상위 시스템보다 상대적으로 29.87% 높였습니다. 다만 현재는 solo performance에 초점을 맞추며, duet·choir·call-and-response를 위한 diarization-aware 확장은 후속 과제로 남아 있습니다.

빠른 이해

새로운 점

가사 정확성과 pitch-rhythm fidelity를 음악적으로 의미 있는 블록 단위에서 결합하고, 조 변경과 표현적 변형을 허용하는 자동 노래 심사 프레임워크입니다.

핵심 메커니즘

공연 입력을 vocal stream과 accompaniment stream으로 분리한 뒤, MG-LoRA로 적응한 Whisper 기반 모델에서 가사를 전사합니다. 전사 구간에 겹치는 sliding-window 후보를 만들고 semantic embedding·fuzzy lexical·phonetic similarity를 결합해 음악적 블록을 찾습니다. 각 블록에서 가사 coverage·correctness·flow와 pitch deviation·stability·voiced-frame rate, beat grid에 대한 onset timing error·bias·stability를 계산합니다. 블록별 content score와 musical score를 가사 쪽에 약간 더 무게를 두어 융합하고 duration weighting으로 전체 performance score와 구간별 feedback을 산출합니다.

핵심 수치

  • 인간 전문가 순위와의 Spearman 상관: 0.683- SwaraLyrics 120개 vocal performance에서 세 명 이상 전문가의 순위와 비교
  • 인간 전문가 순위와의 Kendall’s τ: 0.499- SwaraLyrics 120개 vocal performance에서 측정
  • 통합 평가의 상대 개선: lyric-only 대비 약 +31.9%, music-only 대비 약 +38.0%- MusicJudge의 인간 전문가 순위 상관 기준
  • MG-LoRA 전사 정확도 개선: 차상위 시스템 대비 상대적으로 약 +29.87%- SwaraLyrics·SingMOS-Pro·Jamendo 평균
  • 장르별 word error rate 감소: 20.1 ± 7.52%- MG-LoRA Fine-tuning 전후 비교
  • 블록 경계 탐지 상관: 0.626- SwaraLyrics의 intra-song boundary localization; 차상위 구성보다 +2.96%

섹션별 상세

01

노래 평가의 분리된 기준

기존 Automatic Singing Quality Assessment는 음정·음질을 평가하는 acoustic 방식과 가사를 전사해 정답 가사와 비교하는 lyric 기반 방식으로 나뉘어, 두 정보를 음악 구조 안에서 함께 판단하기 어려웠습니다. acoustic 방식은 가사를 틀리게 불러도 소리가 좋으면 높은 점수를 줄 수 있고, ASR 방식은 sustained vowel·vibrato·melisma·tempo elasticity 때문에 실제 가창 능력과 무관한 전사 오류를 만들었습니다. MusicJudge는 인간 심사위원처럼 가사 정확성과 곡의 melodic·rhythmic structure를 동시에 평가하되, 가수의 음색·음역·표현 방식과 조를 바꾸는 선택을 허용하는 것을 목표로 삼았습니다. 이 문제 설정은 단순한 음향 점수나 전사 정확도만으로는 포착하기 어려운 의도적 improvisation을 평가에 포함시키려는 접근입니다.
02

음악적 블록 기반 평가 파이프라인

MusicJudge는 입력 공연을 먼저 vocal stream과 accompaniment stream으로 분리하고, 보컬에서는 가사·음정, 반주에서는 beat와 tonal context를 추출합니다. 이후 verse·chorus·bridge·alaap처럼 음악적으로 일관된 단위를 블록으로 찾은 뒤 각 블록에서 content fidelity와 musical fidelity를 따로 계산하고 마지막에 duration weighting으로 합칩니다. ASR 경계가 melisma와 vowel elongation 때문에 실제 구절 경계와 어긋나는 문제를 줄이기 위해 transcribed segment에 겹치는 sliding-window 후보를 만들고 semantic embedding similarity, fuzzy lexical matching, phonetic similarity를 결합합니다. 각 블록 안에서는 line-level ordered matching으로 누락·반복·순서 뒤바뀜을 판별하므로 전체 점수뿐 아니라 구간별 가사·음악 점수와 자연어 feedback까지 연결됩니다.
03

MG-LoRA를 이용한 노래 전사 적응

Whisper 기반 모델은 말소리와 다른 노래의 지속음과 장식음을 처리하기 어려워 curated singing data로 Fine-tuning을 진행했으며, 핵심 방법으로 MG-LoRA를 적용했습니다. 일반 sequence-to-sequence loss에 sustained segment의 불안정한 token duration을 억제하는 항, pitch가 매끄러운 구간 내부의 불필요한 token boundary를 줄이는 항, monotonic alignment consistency를 유지하는 항, detected vocal onset과 token boundary를 맞추는 항을 추가했습니다. 입력은 노래 음원과 가사 정렬 정보이고 처리 과정은 LoRA 기반 저순위 적응과 음악 인식 정규화 학습이며 출력은 노래에 맞춰진 전사입니다. 이 설계는 melisma·gamakas·portamento·긴 음의 연장을 단순한 ASR 오류로 처리하지 않고 음악적 구조를 반영해 해석하도록 만드는 데 초점을 둡니다.
04

가사와 음정·리듬 점수 결합

Content score는 탐지된 블록과 reference lyrics를 비교해 coverage·correctness·flow를 결합하고, 누락되거나 반복되거나 순서가 바뀐 line을 반영합니다. Musical score에서는 공연 자체의 accompaniment에서 global key를 추정한 뒤 vocal pitch contour의 in-key deviation·short-term stability·voiced-frame rate로 블록별 pitch fidelity를 계산합니다. Rhythm fidelity는 vocal onset이 accompaniment beat grid에 얼마나 맞는지 timing error·bias·stability statistics로 측정하므로, 가수가 자신의 음역에 맞춰 곡을 transposition해도 감점하지 않으면서 공연 안의 일관성은 유지합니다. 두 점수는 인간 전문가 평가와 비교해 경험적으로 정한 가사 쪽의 약간 더 큰 가중치와 블록 duration weighting을 거쳐 하나의 해석 가능한 performance score가 됩니다.
05

인간 심사와 전사 성능 결과

SwaraLyrics의 120개 vocal performance를 세 명 이상 인간 전문가가 독립적으로 채점한 결과, MusicJudge 순위는 전문가 순위와 Spearman correlation 0.683, Kendall’s τ 0.499를 기록했습니다. 이 결과는 lyric-only 평가보다 약 31.9%, music-only 평가보다 약 38.0% 높아 가사와 음악을 공동 모델링한 효과를 뒷받침합니다. SwaraLyrics·SingMOS-Pro·Jamendo 전체에서 MG-LoRA 전사 정확도는 차상위 시스템보다 상대적으로 약 29.87% 높았고, word error rate는 장르 기준 20.1 ± 7.52%, 언어 기준 27.7 ± 10.87% 감소했습니다. Multi-signal block detection은 단일 matching signal보다 높은 intra-song boundary localization correlation 0.626을 기록했으며, 이는 차상위 구성보다 2.96% 높은 값이고 pitch-region boundary 정규화 항이 Fine-tuning 뒤 가장 큰 단일 증가분을 냈습니다.
06

데이터 설계와 남은 범위

SwaraLyrics는 420개 sample로 구성되며 authoritative playback audio와 native-script lyrics를 연결하고, 다양한 인도 solo music의 장르·분위기·시대·가수 인구집단을 포함합니다. 프로젝트에서는 pitch-rich annotation 부족, 불완전한 lyrics, reference track의 licensing 제약 때문에 데이터 구축이 모델링만큼 큰 작업이었고, Fine-tuning에 사용한 일부 음원은 기관 밴드의 local recording 또는 적절한 라이선스를 거쳤습니다. 공연 자체의 accompaniment에서 key를 추정하고 inference 시 verse·chorus label을 요구하지 않은 설계는 조를 바꾸거나 chorus부터 시작하는 live cover를 불이익 없이 다루기 위한 선택입니다. 현재 MusicJudge는 solo performance를 대상으로 하므로 duet·choir·call-and-response를 처리하려면 diarization awareness를 MG-LoRA에 확장해야 합니다.

용어 해설

자동 노래 품질 평가(Automatic Singing Quality Assessment)
노래 음원의 음정·음질이나 가사 정확성을 자동으로 측정하는 기술입니다. 기존 방식은 소리와 가사를 따로 평가하는 경우가 많아, 음악적 구조와 가사 전달을 함께 판단하는 데 한계가 있습니다.
음원 분리(Source Separation)
하나의 음악 신호에서 보컬과 반주를 분리하는 처리 단계입니다. MusicJudge는 보컬에서 가사와 음정을 추출하고 반주에서 박자와 조성 정보를 얻어 두 분석을 결합합니다.
멜리스마(Melisma)
한 음절을 여러 음에 걸쳐 길게 부르는 가창 기법입니다. 음성 인식 모델이 말소리와 다른 음향 패턴으로 받아들여 가사 경계를 잘못 찾거나 단어를 누락하는 원인이 됩니다.
음악 양식 유도 LoRA(Modality-Guided LoRA)
기존 LoRA 기반 Fine-tuning에 음악 특화 정규화 항을 추가한 적응 방식입니다. 지속 음의 길이, 음정 구간 내부 경계, 보컬 onset을 학습 목표에 반영해 Whisper 기반 모델이 노래의 구조를 고려하도록 만듭니다.
Spearman 상관계수(Spearman Correlation)
두 순위 목록이 얼마나 같은 순서를 따르는지 측정하는 지표입니다. 값이 1에 가까울수록 인간 심사위원의 순위와 자동 평가 결과가 비슷하며, MusicJudge는 SwaraLyrics에서 0.683을 기록했습니다.

기술

  • MusicJudge
  • MG-LoRA
  • Whisper
  • LoRA
  • Automatic Singing Quality Assessment
  • ASR
  • semantic embedding
  • fuzzy lexical matching
  • grapheme-to-phoneme
  • source separation

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 15.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.