kandinskylab/KVAE-Audio
원시 오디오 파형의 압축 및 재구성과 생성 모델에 사용할 연속 잠재공간 제공166.9Mmit
KVAE-Audio는 48 kHz 전대역을 지원하는 연속 오디오 오토인코더로, 166.9M 파라미터와 64차원 잠재로 음성·음악·일반 소리를 고충실도로 재구성하고 생성기 품질을 개선한다.
TL;DR
KVAE-Audio는 KandinskyLab에서 공개한 연속형 전대역(48 kHz) 오디오 오토인코더로서 원시 파형을 64차원 연속 잠재로 압축하고 고충실도로 재구성하도록 설계되었다. 모델은 166.9M 파라미터 규모로 여러 공개 데이터셋(AudioCaps, LibriSpeech, AudioSet, MUSDB18-HQ, EARS)에서 FAD, MEL, SI-SDR, WER, PESQ 등의 객관적 지표와 블라인드 사람 평가에서 비교 우위를 보였으며 특히 동일 생성기 조건에서 잠재공간을 교체할 때 합성 품질이 개선되는 것으로 보고되었다. 공개된 가중치와 MIT 라이선스 배포, 그리고 추후 공개될 기술 보고서는 이 모델을 재구성·생성 파이프라인의 잠재공간으로 활용하는 근거를 제공하며 세부 학습·아키텍처 정보는 기술 보고서에서 추가 공개될 예정이다.
핵심 포인트
- KVAE-Audio는 48 kHz 전대역 연속 잠재 표현을 목표로 설계되어 원시 파형 수준의 고주파 정보 보존에 중점을 두었다. 이 점은 일부 비교 모델이 낮은 샘플링이나 다른 잠재 설계를 사용하는 것과 대조된다. 결과적으로 음악과 고품질 오디오 복원에서 우수한 MEL·waveform·SI-SDR 성능을 기록했다.
- 같은 생성기와 학습 조건을 고정한 '오토인코더 교체' 실험을 통해 잠재공간 자체가 생성 품질에 미치는 영향을 분리해 보여준 점이 차별화 요소이다. 이 실험 설계는 KVAE-Audio가 단순한 복원기 역할을 넘어 생성 파이프라인의 핵심 구성요소로 작동할 수 있음을 증명한다. 블라인드 사람 평가와 객관적 지표의 병행은 이 주장을 지지하는 근거로 제시되었다.
- 상대적으로 적은 파라미터(166.9M)와 중간 크기 잠재(64차원)를 사용하면서 여러 벤치마크에서 최상위 성능을 보인 점이 실용적 차별화로 작용한다. 이는 연산·메모리 자원이 제한된 환경에서도 높은 품질을 달성할 가능성을 시사한다. 공개 라이선스(MIT)로 배포되어 적용 범위가 넓다는 점도 활용성 측면의 구분 요소이다.
- KVAE-Audio는 중간 규모 파라미터(166.9M)와 64차원 잠재 구조를 사용하면서 여러 공개 평가에서 최상위를 기록했다. AudioCaps, AudioSet, LibriSpeech, MUSDB18-HQ, EARS 등 다양한 도메인에서 FAD, MEL, SI-SDR, WER, PESQ 등 지표에서 비교 우위를 보였다. 동일 생성기 조건 하의 블라인드 비교에서도 잠재공간 교체로 생성 품질이 개선된 것으로 보고되어 실용적 이점이 확인되었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AudioCaps CLAP | CLAP | 0.344 | 해당 표에서 가장 높은 값으로 제시됨 |
| LibriSpeech WER | WER | 0.244 | 해당 표에서 가장 낮은 값으로 제시됨 |
| AudioSet MEL | MEL | 0.537 | 해당 표에서 가장 낮은 값으로 제시됨 |
| MUSDB18-HQ SI-SDR | SI-SDR | 10.390 | 해당 표에서 가장 높은 값으로 제시됨 |
| EARS PESQ | PESQ | 4.266 | 해당 표에서 가장 높은 값으로 제시됨 |
이미지 분석



49
LIKES
33
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.