본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

kandinskylab/KVAE-Audio

원시 오디오 파형의 압축 및 재구성과 생성 모델에 사용할 연속 잠재공간 제공166.9Mmit

KVAE-Audio는 48 kHz 전대역을 지원하는 연속 오디오 오토인코더로, 166.9M 파라미터와 64차원 잠재로 음성·음악·일반 소리를 고충실도로 재구성하고 생성기 품질을 개선한다.

TL;DR

KVAE-Audio는 KandinskyLab에서 공개한 연속형 전대역(48 kHz) 오디오 오토인코더로서 원시 파형을 64차원 연속 잠재로 압축하고 고충실도로 재구성하도록 설계되었다. 모델은 166.9M 파라미터 규모로 여러 공개 데이터셋(AudioCaps, LibriSpeech, AudioSet, MUSDB18-HQ, EARS)에서 FAD, MEL, SI-SDR, WER, PESQ 등의 객관적 지표와 블라인드 사람 평가에서 비교 우위를 보였으며 특히 동일 생성기 조건에서 잠재공간을 교체할 때 합성 품질이 개선되는 것으로 보고되었다. 공개된 가중치와 MIT 라이선스 배포, 그리고 추후 공개될 기술 보고서는 이 모델을 재구성·생성 파이프라인의 잠재공간으로 활용하는 근거를 제공하며 세부 학습·아키텍처 정보는 기술 보고서에서 추가 공개될 예정이다.

핵심 포인트

  • KVAE-Audio는 48 kHz 전대역 연속 잠재 표현을 목표로 설계되어 원시 파형 수준의 고주파 정보 보존에 중점을 두었다. 이 점은 일부 비교 모델이 낮은 샘플링이나 다른 잠재 설계를 사용하는 것과 대조된다. 결과적으로 음악과 고품질 오디오 복원에서 우수한 MEL·waveform·SI-SDR 성능을 기록했다.
  • 같은 생성기와 학습 조건을 고정한 '오토인코더 교체' 실험을 통해 잠재공간 자체가 생성 품질에 미치는 영향을 분리해 보여준 점이 차별화 요소이다. 이 실험 설계는 KVAE-Audio가 단순한 복원기 역할을 넘어 생성 파이프라인의 핵심 구성요소로 작동할 수 있음을 증명한다. 블라인드 사람 평가와 객관적 지표의 병행은 이 주장을 지지하는 근거로 제시되었다.
  • 상대적으로 적은 파라미터(166.9M)와 중간 크기 잠재(64차원)를 사용하면서 여러 벤치마크에서 최상위 성능을 보인 점이 실용적 차별화로 작용한다. 이는 연산·메모리 자원이 제한된 환경에서도 높은 품질을 달성할 가능성을 시사한다. 공개 라이선스(MIT)로 배포되어 적용 범위가 넓다는 점도 활용성 측면의 구분 요소이다.
  • KVAE-Audio는 중간 규모 파라미터(166.9M)와 64차원 잠재 구조를 사용하면서 여러 공개 평가에서 최상위를 기록했다. AudioCaps, AudioSet, LibriSpeech, MUSDB18-HQ, EARS 등 다양한 도메인에서 FAD, MEL, SI-SDR, WER, PESQ 등 지표에서 비교 우위를 보였다. 동일 생성기 조건 하의 블라인드 비교에서도 잠재공간 교체로 생성 품질이 개선된 것으로 보고되어 실용적 이점이 확인되었다.

벤치마크

벤치마크지표비교
AudioCaps CLAPCLAP0.344해당 표에서 가장 높은 값으로 제시됨
LibriSpeech WERWER0.244해당 표에서 가장 낮은 값으로 제시됨
AudioSet MELMEL0.537해당 표에서 가장 낮은 값으로 제시됨
MUSDB18-HQ SI-SDRSI-SDR10.390해당 표에서 가장 높은 값으로 제시됨
EARS PESQPESQ4.266해당 표에서 가장 높은 값으로 제시됨

이미지 분석

동일 생성기 조건에서 KVAE-Audio와 SAME-L을 비교한 블라인드 사람 평가와 객관적 지표의 사이드바이사이드 결과를 보여주는 차트이다.
이 차트는 사운드, 음성, 음악 영역에서 'Prompt following'과 'Audio quality' 두 측정을 각각 비교해 KVAE-Audio가 대체로 높은 승률을 기록했음을 시각화한다. 특히 음성의 오디오 품질 항목에서 KVAE-Audio가 뚜렷한 우위를 보인 것으로 나타나 잠재공간의 생성 호환성이 강화되었음을 시사한다. 플롯은 동일 생성기 설정이라는 README의 실험 설계와 일치하는 근거 시각자료로 활용되었다.
KVAE-Audio와 DACVAE MovieGen을 동일 생성기 조건에서 비교한 블라인드 평가 및 승률 차트를 포함한 시각자료이다.
차트는 여러 도메인에서의 'Prompt following'과 'Audio quality' 승률을 분할 막대 형태로 제시해 KVAE-Audio가 대부분의 항목에서 높은 승률을 기록했음을 보여준다. 이 시각적 비교는 표로 제시된 객관적 지표와 병행해 잠재교체가 생성 결과에 미치는 영향을 직관적으로 확인할 수 있게 한다. README의 주장과 일치하게 오토인코더 교체가 생성 품질을 변화시킨다는 근거로 사용되었다.
KVAE-Audio와 MMAudio 44.1kHz를 동일 생성기 조건에서 비교한 블라인드 사람 평가 차트로 구성되어 있다.
이 그래프는 세부 도메인별 승률을 제시하며 KVAE-Audio가 특히 음성 관련 항목에서 높은 승률을 보였음을 나타낸다. 그래프는 README의 'fixed generator' 실험 설정을 시각적으로 보강하며, KVAE-Audio의 잠재가 단순 복원 성능을 넘어 생성기 품질 향상에 기여했음을 뒷받침한다. 샘플별 승률 분포는 표의 객관적 지표와 함께 해석할 때 신뢰도를 높이는 보강 자료로 작용한다.

49

LIKES

33

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.