nvidia/Nemotron-Labs-Audex-2B
Audex-2B는 Nemotron-Cascade-2 기반의 2B 밀집 모델로서 확장된 오디오 어휘와 오디오 인코더를 결합해 음성 인식·번역·오디오 생성·TTS를 지원하면서 텍스트 추론 능력을 대체로 유지한다.
학습 방식 · Nemotron-Cascade-2 텍스트 백본을 기반으로 다단계 SFT(multi-stage SFT)를 적용해 텍스트·오디오 기능을 점진적으로 통합하여 Audex-2B 체크포인트를 획득했으며, 상위 모델인 Audex-30B 계열에는 추가로 cascaded RL이 적용되었다.
TL;DR
Audex-2B는 Nemotron-Cascade-2 텍스트 백본을 기반으로 오디오 인코더와 확장된 오디오 어휘를 통합한 2B 밀집 모델로, 다단계 SFT를 통해 오디오 이해, 음성 인식·번역, 텍스트-음성/텍스트-오디오 생성 및 음성-간 변환을 하나의 체크포인트에서 처리할 수 있도록 설계되었다. 모델은 오디오 입력을 연속 임베딩으로 변환한 뒤 MLP 어댑터로 텍스트 어휘 공간에 주입하고, 확장된 이산 오디오 토큰을 직접 예측하여 XCodec 계열 디코더로 파형을 복원하는 방식으로 동작한다. 배포는 vLLM 기반 추론을 권장하며 최대 128K 토큰 컨텍스트를 지원하므로 긴 문맥의 오디오·텍스트 혼합 작업을 처리할 수 있다. 공개 버전은 다단계 SFT로 학습된 상태이고 라이선스는 NVIDIA의 one-way noncommercial 약관을 따르며, 더 큰 30B 계열은 추가적인 cascaded RL 단계를 거쳐 성능을 보강했다.
핵심 포인트
- 모델은 텍스트 전용 기능을 보존하면서 오디오 입력과 출력 어휘를 직접 통합해 단일 체크포인트로 음성 이해·생성·인식·번역을 모두 처리할 수 있다.
- Audex-2B는 2B의 비교적 작은 파라미터 규모로 설계되어 동일 계열의 30B 모델보다 추론 자원 요구량이 낮다는 점을 목표로 한다.
- 공식 문서에 vLLM 중심의 구체적 배포·실행 스크립트를 제공하여 오디오 워크플로에 특화된 재현성 지침을 함께 제공한다.
- Audex-2B는 오디오 전용 인코더와 확장된 오디오 토큰 어휘를 통합하여 텍스트-오디오 쌍방향 작업을 단일 모델에서 처리할 수 있다. 이 구조는 별도 음성-특화 모델과의 파이프라인 결합 없이 음성 인식, 번역, 생성 기능을 제공한다. 경량 2B 규모로 설계되어 상대적으로 추론 자원 요구량이 낮다는 점이 실용적 장점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| context_length | max_tokens | 128K | — |
이미지 분석




69
LIKES
1.7k
DOWNLOADS
5 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.