본문으로 건너뛰기
HF Daily Papers조회 1

SpotSound: 세밀한 시간적 그라운딩을 통한 대형 오디오-언어 모델 강화

대형 오디오-언어 모델(ALM)은 전체적인 오디오 이해도는 높지만, 특정 사건이 정확히 언제 발생하는지 찾아내는 시간적 그라운딩 능력이 부족했다. 이 논문은 타임스탬프 토큰을 오디오 특징과 교차 배치하는 방식과 환각 억제 학습 목적 함수를 도입하여, 복잡한 배경음 속에서도 짧은 소리 이벤트를 정확히 찾아내는 기술적 돌파구를 마련했다.

왜 중요한가

대형 오디오-언어 모델(ALM)은 전체적인 오디오 이해도는 높지만, 특정 사건이 정확히 언제 발생하는지 찾아내는 시간적 그라운딩 능력이 부족했다. 이 논문은 타임스탬프 토큰을 오디오 특징과 교차 배치하는 방식과 환각 억제 학습 목적 함수를 도입하여, 복잡한 배경음 속에서도 짧은 소리 이벤트를 정확히 찾아내는 기술적 돌파구를 마련했다.

핵심 기여

타임스탬프 인터리빙 시퀀스 구조

오디오 특징 벡터 사이에 텍스트 형태의 타임스탬프 토큰을 1초 간격으로 직접 삽입하여 모델이 오디오 신호와 시간 정보를 명시적으로 정렬하도록 설계했다.

환각 억제 학습 목적 함수

오디오에 존재하지 않는 이벤트에 대한 부정적 쿼리를 포함한 4개 요소(오디오, 긍정 쿼리, 정답 시간, 부정 쿼리) 포맷으로 학습시켜 존재하지 않는 소리에 대한 시간 예측 환각을 방지했다.

SpotSound-Bench 벤치마크 공개

전체 오디오 길이 대비 타겟 이벤트 비중이 10% 미만인 '바늘 찾기' 시나리오를 시뮬레이션한 고난도 시간적 그라운딩 평가 데이터셋을 구축했다.

핵심 아이디어 이해하기

기존 ALM은 오디오 전체를 요약하는 데는 능숙하지만, 특정 소리가 시작되고 끝나는 지점을 찾는 데는 취약하다. 이는 학습 데이터가 대개 클립 단위의 요약문으로만 구성되어 있고, 모델 내부적으로 오디오 특징과 절대적 시간 정보 사이의 연결 고리가 약하기 때문이다. Transformer 기반 모델에서 위치 인코딩(Positional Encoding)만으로는 수십 초 길이의 오디오 내에서 수 초 단위의 이벤트를 정밀하게 특정하기 어렵다는 한계가 있다.

SpotSound는 이 문제를 해결하기 위해 오디오 임베딩 시퀀스 중간중간에 'timestamp: 1.0s'와 같은 텍스트 토큰을 물리적으로 끼워 넣는 방식을 채택했다. 이는 모델이 Attention 연산을 수행할 때 주변 오디오 특징이 어느 시간대에 속하는지 텍스트 토큰을 통해 직접 참조할 수 있게 만든다. 마치 영상 편집 타임라인에 눈금자를 직접 그려 넣은 것과 같은 원리다.

또한, 모델이 소리가 없는데도 시간을 지어내는 '환각'을 막기 위해 이진 분류(소리 존재 여부 확인)와 시간 회귀(구간 특정)를 결합한 2단계 추론 구조를 학습에 도입했다. 이를 통해 모델은 단순히 패턴을 맞추는 것이 아니라, 실제 소리 신호의 존재를 먼저 검증한 뒤에만 시간 구간을 출력하도록 유도된다.

방법론

SpotSound의 핵심은 타임스탬프-인터리빙 시퀀스 구성이다. 오디오 인코더(Whisper-large-v3)에서 추출된 특징 벡터 A_i와 1초 단위의 텍스트 토큰 T_i를 [T1; A1; T2; A2; ...] 형태로 결합한다. 이 시퀀스를 Qwen2-7B 또는 Audio Flamingo 3와 같은 LLM 백본에 입력하여 자연어 쿼리에 대응하는 시간 구간을 'From Xs to Ys' 형태로 출력하게 한다.

학습 전략은 2단계 문제 정의를 따른다. 첫 번째 단계에서는 이진 분류 지시어 I_E를 통해 해당 소리의 존재 여부(Yes/No)를 예측한다. [입력 오디오 및 쿼리 → LLM 추론 → Yes/No 출력] 과정을 거치며, 존재하지 않는 소리에 대해 'No'라고 답하도록 학습하여 환각을 억제한다. 두 번째 단계에서는 소리가 존재할 경우에만 구체적인 시작 및 종료 시간 W를 예측하는 지시어 I_G를 수행한다.

데이터셋 구축을 위해 AudioSet Strong Label과 VGGSound 데이터를 활용하여 10,000개의 합성 샘플을 생성했다. DeepSeek-v3를 사용해 상세한 오디오 캡션을 생성하고, 이를 배경 소음(Walking Tours 데이터)과 무작위로 믹싱하여 실제 환경과 유사한 'needle-in-a-haystack' 환경을 조성했다. 학습 시에는 LoRA(rank=8, alpha=16)를 사용하여 LLM 파라미터를 효율적으로 미세 조정했다.

관련 Figure

SpotSound 모델 아키텍처 및 데이터 생성 파이프라인 다이어그램
Diagram

오디오 토큰 사이에 타임스탬프 토큰이 인터리빙되는 구조(a)와 LLM을 활용해 캡션을 생성하고 배경음과 합성하는 데이터 구축 과정(b)을 상세히 설명한다. 이는 모델의 핵심 동작 원리와 학습 데이터 확보 전략을 이해하는 데 필수적이다.

SpotSound 모델 아키텍처 및 데이터 생성 파이프라인 다이어그램

주요 결과

SpotSound-Bench 벤치마크에서 SpotSound-A 모델은 mIoU 52.7%를 기록하며 기존 SOTA 모델인 AM-DETR(22.5%) 및 Audio Flamingo 3(9.1%)를 압도적으로 능가했다. 특히 타겟 이벤트가 매우 짧은 환경에서도 높은 정밀도를 유지했다.

Clotho-Moment 데이터셋에서는 mIoU 85.6%를 달성하여 기존 최고 성능 모델 대비 약 4.7%p 향상된 결과를 보였다. UnAV-100 subset에서도 mIoU 69.8%를 기록하며 기존 모델들(최대 42.8%) 대비 비약적인 성능 향상을 입증했다.

환각 억제 실험에서 SpotSound는 존재하지 않는 소리에 대해 'No'라고 정확히 답하는 정확도가 Clotho-Moment 기준 85.4%에 달했다. 이는 기존 ALM들이 존재하지 않는 소리에 대해서도 습관적으로 시간 구간을 출력하던 문제(환각)를 효과적으로 해결했음을 보여준다.

관련 Figure

SpotSound의 정성적 예시와 4개 벤치마크에서의 성능 비교 레이더 차트
Chart

SpotSound가 소리 존재 여부를 정확히 판단하고(Yes/No), 발생 구간을 초 단위로 특정하는 모습을 보여준다. 레이더 차트(c)는 SpotSound가 기존 모델들(빨간색) 대비 모든 지표에서 월등한 성능(파란색)을 기록함을 시각화한다.

SpotSound의 정성적 예시와 4개 벤치마크에서의 성능 비교 레이더 차트

기술 상세

SpotSound 아키텍처는 Whisper-large-v3 오디오 인코더와 Qwen2-7B 또는 Audio Flamingo 3 LLM을 결합한 구조다. 오디오 신호는 16kHz로 리샘플링된 후 128채널 멜-스펙트로그램으로 변환되며, 인코더를 거쳐 약 40ms 단위의 토큰으로 표현된다. 핵심 차별점은 절대적 시간 정보를 텍스트 토큰으로 삽입하여 LLM의 컨텍스트 윈도우 내에서 오디오 특징과 시간을 하드-얼라인먼트(Hard-alignment) 시킨 점이다.

학습 시 Negative Sampling 전략을 사용하여 견고성을 높였다. 각 오디오 클립에 대해 실제 존재하는 소리(Positive Query)와 존재하지 않는 소리(Negative Query)를 쌍으로 구성하여 모델이 '존재 여부 판단'을 선행하도록 강제했다. 이는 기존 모델들이 오디오 신호와 무관하게 쿼리 텍스트에만 의존해 시간 구간을 생성하던 Prior Bias 문제를 해결한다.

구현 측면에서 30초 이상의 긴 오디오는 30초 단위 세그먼트로 나누어 독립적으로 인코딩한 후 시간 순서대로 연결하여 처리한다. LoRA 파인튜닝 시 rank=8 설정이 성능과 효율성 사이에서 최적의 균형을 보였으며, 타임스탬프의 해상도는 1초 단위가 추론 지연 시간과 그라운딩 정확도 측면에서 가장 적절한 것으로 나타났다.

관련 Figure

타 모델과의 시간적 그라운딩 및 환각 발생 비교 사례
Screenshot

Kimi-Audio, Audio Flamingo 3 등 기존 모델들이 존재하지 않는 소리에 대해 잘못된 시간 구간을 출력(환각)하는 반면, SpotSound-A는 정확히 'No'라고 판단하는 대비를 보여준다. 이는 제안된 학습 목적 함수의 효과를 증명한다.

타 모델과의 시간적 그라운딩 및 환각 발생 비교 사례

한계점

여러 개의 동일한 소리 이벤트가 반복되는 '멀티-인스턴스' 시나리오에서 모델이 가장 두드러진 이벤트 하나만 찾고 조기에 생성을 종료하는 경향이 있다. 또한, 시간적 정밀도는 학습 데이터의 주석 품질과 입도(granularity)에 직접적으로 제한을 받는다.

실무 활용

SpotSound는 긴 오디오 파일 내에서 특정 사건의 발생 시점을 정밀하게 찾아내야 하는 실무 환경에 즉시 적용 가능하다. 특히 보안 관제나 미디어 분석처럼 방대한 데이터 속에서 찰나의 순간을 포착해야 하는 분야에서 유용하다.

  • 보안 감시: 수 시간 분량의 CCTV 오디오에서 '유리창 깨지는 소리'나 '비명 소리'가 발생한 정확한 시점 추출
  • 미디어 포렌식: 뉴스나 인터뷰 녹취록에서 특정 키워드나 배경 사건이 언급된 구간을 초 단위로 자동 인덱싱
  • 오디오 편집 도구: 팟캐스트나 영상 편집 시 '박수 소리'나 '웃음 소리'가 나오는 구간을 자동으로 찾아 컷 편집 지원

코드 공개 여부: 공개

코드 저장소 보기

키워드

ALM(대형 오디오-언어 모델)Temporal Grounding(시간적 그라운딩)Hallucination(환각)Timestamp Interleaving(타임스탬프 인터리빙)Audio Understanding(오디오 이해)
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 14.수집 2026. 04. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.