본문으로 건너뛰기

music-bench: LLM의 악보 인식(Musical OCR) 성능 측정을 위한 벤치마크

최신 LLM들의 악보 인식 능력을 평가하는 music-bench 결과, GPT-5.4를 포함한 주요 모델들이 매우 낮은 정확도를 보임이 확인됐다.

섹션별 상세

01
music-bench는 LLM의 악보 인식 능력을 측정하기 위해 개발된 벤치마크다. 현재는 단일 오선지의 단음 식별이라는 기초적인 단계로 구성되어 있으나, 모델들의 성능이 매우 낮아 더 복잡한 과제는 포함되지 않았다. 이는 최신 멀티모달 모델들이 악보라는 특수한 시각 언어를 해석하는 데 근본적인 어려움을 겪고 있음을 의미한다.
02
주요 상용 모델들을 대상으로 한 성능 평가에서 충격적인 결과가 나타났다. GPT-5.4는 Exact Match 8.3%, 평균 F1 0.3265를 기록했으며, Claude Opus 4-6은 단 하나의 테스트 케이스도 완벽히 맞추지 못해 0%의 정확도를 보였다. 이러한 수치는 현재의 범용 LLM이 악보 데이터를 처리하는 데 있어 신뢰할 수 없는 수준임을 입증한다.
03
데이터셋은 LilyPond 엔진을 통해 동적으로 생성되며 공정한 평가를 위한 장치를 포함한다. 특히 두 개의 거의 동일한 악보 이미지가 서로 다른 정답을 가지도록 설계된 대비 쌍(contrast pairs)을 생성하여 모델이 시각적 지름길을 통해 정답을 맞히는 것을 방지한다. 또한 dev, public_test, private_test로 데이터셋을 분리하여 모델 오염에 대응한다.
bash
python3 -m venv .venv && source .venv/bin/activate && pip install -e . && python -m music_bench generate --output-dir data/generated --dev-count 8 --public-test-count 16

가상 환경을 설정하고 music-bench 라이브러리를 설치한 뒤 테스트 데이터셋을 생성하는 과정

bash
brew install lilypond && python -m music_bench render --manifest data/generated/dev/manifest.jsonl

LilyPond를 설치하고 생성된 데이터셋의 악보 이미지를 렌더링하는 과정

04
구체적인 오답 사례 분석을 통해 모델의 취약점이 명확히 드러났다. F4, A4, F5 등의 음표가 포함된 마디에 대해 GPT-5.4는 옥타브나 음높이를 혼동했으며, Claude는 존재하지 않는 음표들을 대량으로 생성하는 환각 현상을 보였다. 이는 모델이 오선지 위의 수직적 위치와 수평적 순서를 정확한 음악적 정보로 변환하는 추론 능력이 부족함을 나타낸다.
F4, A4, F5, A4, G5 음표가 포함된 단일 마디 악보 이미지다.
Screenshot본문에서 GPT-5.4, Claude, Gemini 등 모든 테스트 모델이 오답을 낸 대표적인 사례로 나타났다. 모델들이 오선지 상의 음표 위치를 정확한 음이름과 옥타브로 변환하는 데 실패함을 시각적으로 증명한다.

용어 해설

악보 광학 문자 인식(Musical OCR)
이미지 형태의 악보를 디지털 음악 데이터로 변환하는 기술이다. 모델이 오선지, 음표, 기호 간의 공간적 관계를 이해해야 하므로 일반 OCR보다 난이도가 높다.
완전 일치(Exact Match)
모델의 출력이 정답 시퀀스와 토큰 단위까지 완벽하게 일치하는 비율을 측정하는 지표다. 악보 인식에서는 모든 음표의 음이름과 옥타브가 정확해야 하므로 매우 엄격한 기준이 된다.
릴리폰드(LilyPond)
텍스트 기반의 입력을 고품질의 악보 이미지로 렌더링해주는 오픈소스 악보 조판 시스템이다. music-bench에서는 프로그래밍 방식으로 다양한 난이도의 테스트 데이터를 생성하는 핵심 엔진으로 사용된다.
대비 쌍(Contrast Pairs)
거의 동일한 시각적 특징을 가지지만 정답은 서로 다른 데이터 쌍을 의미한다. 모델이 데이터셋의 통계적 특성이나 시각적 패턴을 단순 암기하여 정답을 맞히는 지름길 학습을 방지하는 데 효과적이다.
편집 거리(Edit Distance)
두 시퀀스 사이의 차이를 측정하기 위해 필요한 삽입, 삭제, 교체 연산의 최소 횟수를 의미한다. 악보 인식에서 모델이 음표를 얼마나 빠뜨리거나 잘못 추가했는지 정량적으로 평가하는 데 사용된다.

기술

  • GPT-5.4
  • Claude Opus 4-6
  • Gemini 3 Flash Preview
  • LilyPond
  • Python

활용 사례

  • Musical OCR 성능 측정
  • LLM 멀티모달 벤치마킹

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 03.수집 2026. 04. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.