MoE 30B 기반으로 텍스트·음성을 통합해 1M 토큰 대화와 직접 오디오 생성까지 지원하는 Audex 30
Nemotron-Cascade-2-30B-A3B를 백본으로 삼아 오디오 인코더와 이산 오디오 토큰을 통합한 멀티모달 LLM로 텍스트 추론 성능을 유지하면서 음성 인식·번역·TTS·TTA·S2S를 단일 모델에서 수행한다.
TL;DR
Audex-30B-A3B는 Nemotron-Cascade-2-30B-A3B MoE 백본(30B 규모, 활성화 파라미터 약 3B)을 확장해 오디오 인코더와 MLP 어댑터를 추가하고 이산 오디오 토큰 어휘를 도입함으로써 텍스트 추론 성능을 유지하면서 음성 인식·번역, 오디오 이해, TTS·TTA·S2S 같은 오디오 생성 능력을 단일 모델로 통합했다. 입력 오디오는 연속 임베딩으로 인코딩되어 어댑터를 통해 백본에 주입되며 출력은 텍스트와 음성·오디오 토큰을 동일 생성 루프에서 직접 예측해 디코더로 복원하는 흐름을 따른다. 학습은 오디오 워밍업과 단계적 SFT 또는 통합 SFT을 거친 뒤 Nemotron-Cascade-2 스타일의 계단식 강화학습을 적용해 응답 품질과 정렬 특성을 보강했고 권장 추론 환경은 vLLM이며 최대 1M 토큰 문맥을 지원한다. 결과 표는 Audex가 오디오 태스크에서 강한 성능을 보고하면서도 백본의 텍스트 능력을 거의 회복하거나 유지했음을 시사하나 라이선스는 비상업적 사용으로 제한되어 상용 배포 전 라이선스 검토가 필요하다.
핵심 역량
- 오디오 입력을 연속 임베딩으로 인코딩한 뒤 MLP 어댑터로 텍스트 백본에 주입해 오디오 이해와 질문응답을 수행할 수 있다.
- 음성 인식과 음성 번역을 수행할 수 있으며, 음성 출력은 이산 음성 토큰을 직접 생성해 디코더로 변환할 수 있다.
- 텍스트-음성(text-to-speech) 및 텍스트-오디오(text-to-audio) 합성이 가능하며, XCodec 계열 디코더와 연동해 파형을 복원할 수 있다.
- 긴 문맥 처리(최대 1M 토큰)를 지원해 장시간 대화·멀티턴 오디오-텍스트 상호작용을 유지할 수 있다.
- 텍스트 전용 추론 모드(Thinking)와 지시형 모드(Instruct)를 모두 지원해 내부 사고 토큰(<think>)을 통한 체인오브생각 스타일의 처리와 빠른 응답 모드를 전환할 수 있다.
강점
- 텍스트 전용 백본의 추론·정렬·지식 능력을 유지하면서 오디오 이해와 생성 능력을 추가해 단일 모델로 광범위한 오디오-텍스트 워크로드를 처리하는 통합성을 보인다.
- 최대 1M 토큰의 문맥 길이를 지원해 장기간 대화 및 다중 발화 연속 처리에서 우위를 갖는다.
- vLLM 최적화 환경을 통해 오디오 입력·생성 모두에서 실무적 추론 파이프라인을 제공해 배포·재현성 측면에서 실용적이다.
훈련 방식
Nemotron-Cascade-2-30B-A3B를 기반으로 다단계 SFT(multi-stage SFT)와 통합형 단일 SFT(consolidated SFT)를 실험한 뒤 Cascade-2 스타일의 RL(MOPD 포함)을 텍스트 도메인에서 계단식으로 적용하여 Audex를 최종화했다.
알아두면 좋은 것
- 모델은 Nemotron-Cascade-2-30B-A3B MoE 백본을 확장해 오디오 토큰 어휘와 오디오 인코더, MLP 어댑터를 추가한 구조로 설계되었다.
- 권장 추론 엔진은 vLLM이며 vLLM 환경에서 오디오 입력과 오디오 생성 파이프라인을 지원하도록 구성되어 있다.
- 텍스트-오디오 합성은 XCodec1/XCodec2 디코더를 사용하며 품질 향상을 위한 48 kHz 향상 VAE 적용이 가능하다.
- 라이선스는 NVIDIA-OneWay-Noncommercial-License로 비상업적 사용 조건이 명시되어 있다.
기술적 특징
- 백본으로 Nemotron-Cascade-2-30B-A3B MoE 아키텍처를 사용했으며 모델은 30B 규모의 MoE 구조로 설계되고 특정 입력마다 약 3B 파라미터만 활성화해 계산 효율을 확보했다. 이 설계는 대규모 문맥과 복합 태스크를 효율적으로 처리하면서 텍스트 추론 성능을 보존하는 데 목적이 있다.
- 오디오 처리는 별도의 오디오 인코더를 통해 연속 임베딩으로 변환한 뒤 MLP 어댑터로 백본의 입력 공간으로 매핑해 통합한다. 이 과정은 전체 모델 가중치를 재학습하지 않고도 오디오-텍스트 융합을 가능하게 하여 확장성과 유지보수 비용을 줄였다.
- 오디오 출력은 확장된 어휘의 이산 오디오 및 음성 토큰을 직접 예측하도록 설계되어 텍스트 토큰과 동일한 생성 루프에서 TTS·TTA·S2S를 수행할 수 있다. 이 접근은 별도 후처리 없이 모델 자체에서 오디오 토큰 시퀀스를 생성하여 디코더로 디코딩하는 흐름을 단순화한다.
- 학습 파이프라인은 오디오 워밍업, 오디오 생성 SFT, 오디오 이해 SFT를 단계적으로 적용하는 multi-stage SFT와 모든 태스크를 한 번에 합친 single-stage consolidated SFT를 모두 실험했으며 이후 Cascade-2 기반의 강화학습(RL + MOPD)을 통해 응답 품질과 정렬 특성을 추가로 개선했다.
- 추론 측면에서는 vLLM을 권장하며 vLLM 환경에서 오디오 입력 디코딩과 오디오 생성 파이프라인을 통합해 배포 가능하도록 구성했다. Hugging Face/transformers 환경도 지원하지만 특정 오디오 확장(예: mamba-ssm, causal-conv1d) 빌드가 필요하다.
차별점
- 텍스트 전용 강력한 MoE 백본을 유지하면서 오디오 토큰과 오디오 인코더를 어휘·아키텍처 수준에서 통합한 단일 모델 설계를 채택했다.
- 이산 오디오 토큰을 직접 예측하여 텍스트-오디오-음성 생성 파이프라인을 별도 시스템 없이 모델 내부에서 처리할 수 있다.
- 최대 1M 토큰의 문맥 길이를 지원해 장기간 대화 및 긴 오디오 컨텍스트를 처리할 수 있도록 설계되었다.
- vLLM 중심의 권장 추론 스택과 함께 오디오 전처리·디코딩 스크립트를 제공해 실무적 재현성을 확보했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Redux | accuracy | 86.4 | — |
| OpenASR | WER | 6.82 | — |
| LibriSpeech (clean) | WER | 1.34 | — |
| Seed-TTS-Eval (text-to-speech) | WER | 1.70 | — |
| BigBenchAudio | score | 90.0 | — |
| AudioCaps (OpenL3 Fréchet Distance) | Fréchet Distance | 66.9 | — |
이미지 분석




161
Likes
2.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.