nvidia/Nemotron-Labs-Audex-30B-A3B
Nemotron-Cascade-2-30B-A3B를 백본으로 삼아 오디오 인코더와 이산 오디오 토큰을 통합한 멀티모달 LLM로 텍스트 추론 성능을 유지하면서 음성 인식·번역·TTS·TTA·S2S를 단일 모델에서 수행한다.
학습 방식 · Nemotron-Cascade-2-30B-A3B를 기반으로 다단계 SFT(multi-stage SFT)와 통합형 단일 SFT(consolidated SFT)를 실험한 뒤 Cascade-2 스타일의 RL(MOPD 포함)을 텍스트 도메인에서 계단식으로 적용하여 Audex를 최종화했다.
TL;DR
Audex-30B-A3B는 Nemotron-Cascade-2-30B-A3B MoE 백본(30B 규모, 활성화 파라미터 약 3B)을 확장해 오디오 인코더와 MLP 어댑터를 추가하고 이산 오디오 토큰 어휘를 도입함으로써 텍스트 추론 성능을 유지하면서 음성 인식·번역, 오디오 이해, TTS·TTA·S2S 같은 오디오 생성 능력을 단일 모델로 통합했다. 입력 오디오는 연속 임베딩으로 인코딩되어 어댑터를 통해 백본에 주입되며 출력은 텍스트와 음성·오디오 토큰을 동일 생성 루프에서 직접 예측해 디코더로 복원하는 흐름을 따른다. 학습은 오디오 워밍업과 단계적 SFT 또는 통합 SFT을 거친 뒤 Nemotron-Cascade-2 스타일의 계단식 강화학습을 적용해 응답 품질과 정렬 특성을 보강했고 권장 추론 환경은 vLLM이며 최대 1M 토큰 문맥을 지원한다. 결과 표는 Audex가 오디오 태스크에서 강한 성능을 보고하면서도 백본의 텍스트 능력을 거의 회복하거나 유지했음을 시사하나 라이선스는 비상업적 사용으로 제한되어 상용 배포 전 라이선스 검토가 필요하다.
핵심 포인트
- 텍스트 전용 강력한 MoE 백본을 유지하면서 오디오 토큰과 오디오 인코더를 어휘·아키텍처 수준에서 통합한 단일 모델 설계를 채택했다.
- 이산 오디오 토큰을 직접 예측하여 텍스트-오디오-음성 생성 파이프라인을 별도 시스템 없이 모델 내부에서 처리할 수 있다.
- 최대 1M 토큰의 문맥 길이를 지원해 장기간 대화 및 긴 오디오 컨텍스트를 처리할 수 있도록 설계되었다.
- vLLM 중심의 권장 추론 스택과 함께 오디오 전처리·디코딩 스크립트를 제공해 실무적 재현성을 확보했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Redux | accuracy | 86.4 | — |
| OpenASR | WER | 6.82 | — |
| LibriSpeech (clean) | WER | 1.34 | — |
| Seed-TTS-Eval (text-to-speech) | WER | 1.70 | — |
| BigBenchAudio | score | 90.0 | — |
| AudioCaps (OpenL3 Fréchet Distance) | Fréchet Distance | 66.9 | — |
이미지 분석




161
LIKES
2.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.