본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Nemotron-Labs-Audex-30B-A3B

오디오 이해(오디오 QA), 음성 인식 및 번역, 텍스트-음성 및 텍스트-오디오 합성, 음성-음성 변환과 텍스트 생성 기반의 추론을 포함한 통합 오디오-텍스트 멀티태스크30B (MoE), 3B activated parameters1K 컨텍스트nvidia-oneway-noncommercial-license

Nemotron-Cascade-2-30B-A3B를 백본으로 삼아 오디오 인코더와 이산 오디오 토큰을 통합한 멀티모달 LLM로 텍스트 추론 성능을 유지하면서 음성 인식·번역·TTS·TTA·S2S를 단일 모델에서 수행한다.

학습 방식 · Nemotron-Cascade-2-30B-A3B를 기반으로 다단계 SFT(multi-stage SFT)와 통합형 단일 SFT(consolidated SFT)를 실험한 뒤 Cascade-2 스타일의 RL(MOPD 포함)을 텍스트 도메인에서 계단식으로 적용하여 Audex를 최종화했다.

TL;DR

Audex-30B-A3B는 Nemotron-Cascade-2-30B-A3B MoE 백본(30B 규모, 활성화 파라미터 약 3B)을 확장해 오디오 인코더와 MLP 어댑터를 추가하고 이산 오디오 토큰 어휘를 도입함으로써 텍스트 추론 성능을 유지하면서 음성 인식·번역, 오디오 이해, TTS·TTA·S2S 같은 오디오 생성 능력을 단일 모델로 통합했다. 입력 오디오는 연속 임베딩으로 인코딩되어 어댑터를 통해 백본에 주입되며 출력은 텍스트와 음성·오디오 토큰을 동일 생성 루프에서 직접 예측해 디코더로 복원하는 흐름을 따른다. 학습은 오디오 워밍업과 단계적 SFT 또는 통합 SFT을 거친 뒤 Nemotron-Cascade-2 스타일의 계단식 강화학습을 적용해 응답 품질과 정렬 특성을 보강했고 권장 추론 환경은 vLLM이며 최대 1M 토큰 문맥을 지원한다. 결과 표는 Audex가 오디오 태스크에서 강한 성능을 보고하면서도 백본의 텍스트 능력을 거의 회복하거나 유지했음을 시사하나 라이선스는 비상업적 사용으로 제한되어 상용 배포 전 라이선스 검토가 필요하다.

핵심 포인트

  • 텍스트 전용 강력한 MoE 백본을 유지하면서 오디오 토큰과 오디오 인코더를 어휘·아키텍처 수준에서 통합한 단일 모델 설계를 채택했다.
  • 이산 오디오 토큰을 직접 예측하여 텍스트-오디오-음성 생성 파이프라인을 별도 시스템 없이 모델 내부에서 처리할 수 있다.
  • 최대 1M 토큰의 문맥 길이를 지원해 장기간 대화 및 긴 오디오 컨텍스트를 처리할 수 있도록 설계되었다.
  • vLLM 중심의 권장 추론 스택과 함께 오디오 전처리·디코딩 스크립트를 제공해 실무적 재현성을 확보했다.

벤치마크

벤치마크지표비교
MMLU-Reduxaccuracy86.4
OpenASRWER6.82
LibriSpeech (clean)WER1.34
Seed-TTS-Eval (text-to-speech)WER1.70
BigBenchAudioscore90.0
AudioCaps (OpenL3 Fréchet Distance)Fréchet Distance66.9

이미지 분석

모델의 주요 벤치마크 표로서 텍스트·추리·지식·정렬·긴문맥·오디오 관련 태스크별 수치를 정리하고 있다.
표는 Audex-30B-A3B의 다양한 태스크별 성능을 수치로 비교해 보여주며 오디오 이해, 음성 인식·번역, TTS, TTA, S2S 같은 오디오 관련 항목에서 우수한 성능을 보고하고 있다. 또한 표의 우측 컬럼에 Audex 결과가 강조되어 있어 텍스트 전용 백본 성능을 보존하면서 오디오 능력이 추가되었음을 정량적으로 확인할 수 있다.
Audex의 아키텍처 다이어그램으로 오디오 인코더, MLP 어댑터, MoE 기반 LLM 백본 및 음성·오디오 디코더의 연결을 시각화하고 있다.
다이어그램은 오디오 입력이 오디오 인코더를 거쳐 MLP 어댑터로 변환된 연속 임베딩이 LLM 백본에 투입되는 흐름을 보여준다. 또한 확장된 어휘를 통해 텍스트 토큰뿐 아니라 음성·오디오 토큰을 직접 예측하고 별도의 디코더로 출력하는 설계를 명확히 제시하고 있어 통합 생성 파이프라인의 구조적 근거를 제공한다.
입력·출력 템플릿 캡처로서 텍스트 채팅, 오디오 QA, TTS, TTA 등 태스크별 프롬프트 구조와 특수 토큰 사용 방식을 보여준다.
이미지는 ChatML 기반의 대화 템플릿과 오디오를 삽입하는 <sound> 토큰 및 오디오 생성 플레이스홀더(<audiogen>) 사용 예시를 포함해 실제 입력 포맷과 응답 모드(think 태그 기반 사고 모드 vs non-thinking 모드)를 구체적으로 제시한다. 이 템플릿은 오디오 및 텍스트 통합 입력을 올바르게 구성하고 vLLM 또는 transformers 환경에서 일관된 추론을 가능하게 한다.
학습 파이프라인 다이어그램으로 multi-stage SFT, single-stage consolidated SFT, 그리고 Cascade-2 기반의 RL 적용 흐름을 도식화하고 있다.
다이어그램은 먼저 텍스트 SFT와 오디오 워밍업을 거쳐 오디오 생성·오디오 이해 SFT를 단계적으로 쌓는 경로와 모든 태스크를 한 번에 합쳐 학습하는 통합 경로를 병렬로 제시한다. 이후 Audex SFT 결과에 대해 Nemotron-Cascade-2 스타일의 강화학습(RL + MOPD)을 적용하는 흐름을 보여주어 모델이 어떻게 정렬과 품질 보정을 달성했는지 학습 단계별로 파악할 수 있게 한다.

161

LIKES

2.1k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.