오디오 토큰을 직접 생성하는 2B 통합 오디오·텍스트 LLM, 128K 컨텍스트
Audex-2B는 Nemotron-Cascade-2 기반의 2B 밀집 모델로서 확장된 오디오 어휘와 오디오 인코더를 결합해 음성 인식·번역·오디오 생성·TTS를 지원하면서 텍스트 추론 능력을 대체로 유지한다.
TL;DR
Audex-2B는 Nemotron-Cascade-2 텍스트 백본을 기반으로 오디오 인코더와 확장된 오디오 어휘를 통합한 2B 밀집 모델로, 다단계 SFT를 통해 오디오 이해, 음성 인식·번역, 텍스트-음성/텍스트-오디오 생성 및 음성-간 변환을 하나의 체크포인트에서 처리할 수 있도록 설계되었다. 모델은 오디오 입력을 연속 임베딩으로 변환한 뒤 MLP 어댑터로 텍스트 어휘 공간에 주입하고, 확장된 이산 오디오 토큰을 직접 예측하여 XCodec 계열 디코더로 파형을 복원하는 방식으로 동작한다. 배포는 vLLM 기반 추론을 권장하며 최대 128K 토큰 컨텍스트를 지원하므로 긴 문맥의 오디오·텍스트 혼합 작업을 처리할 수 있다. 공개 버전은 다단계 SFT로 학습된 상태이고 라이선스는 NVIDIA의 one-way noncommercial 약관을 따르며, 더 큰 30B 계열은 추가적인 cascaded RL 단계를 거쳐 성능을 보강했다.
핵심 역량
- Audex-2B는 오디오 입력을 오디오 인코더로 연속 임베딩으로 변환한 뒤 MLP 어댑터를 통해 LLM의 어휘 공간으로 매핑해 오디오 이해 질의를 처리할 수 있다. 이 과정에서 음성 내부의 발화 내용과 환경 정보를 텍스트 응답으로 반환하거나, 필요시 음성 번역을 수행할 수 있다. 모델은 동일한 구조에서 텍스트 기반 사고 모드와 비사고(instruct) 모드를 전환하여 다양한 출력 스타일을 제공한다.
- Audex-2B는 확장된 이산 오디오 토큰 어휘를 사용해 직접 오디오 토큰을 예측함으로써 텍스트에서 오디오를 생성하는 TTS와 TTA 파이프라인을 지원한다. 생성 과정은 XCodec 계열 디코더(예: XCodec1 또는 XCodec2)를 통해 토큰을 실제 파형으로 복원하는 방식으로 구성되어 있다. 이 방식을 통해 스트리밍과 비스트리밍 디코더 옵션을 모두 활용할 수 있다.
- Audex-2B는 음성 인식 및 음성 번역에서 greedy 샘플링 또는 vLLM 기반의 생성 파라미터(top_p, temperature) 설정을 통해 다양한 정확도/속도 트레이드오프를 제공한다. README 권장 설정은 음성 인식·번역에 greedy 샘플링, 오디오 이해에는 top_p=0.9와 temperature=0.7을 권장한다. 이 설정은 오디오 QA 파이프라인의 실용적 균형을 맞추기 위한 것으로 문서에 명시되어 있다.
- Audex-2B는 최대 128K 토큰의 컨텍스트 길이를 지원하도록 구성되어 있어 긴 대화나 긴 오디오-텍스트 혼합 문맥을 처리할 수 있다. 긴 컨텍스트는 멀티턴 오디오 QA나 긴 음성-텍스트 혼합 세션에서 상태를 유지하는 데 유리하다. vLLM 런타임과의 연동을 통해 대규모 컨텍스트 처리와 배치형 추론을 병행할 수 있도록 설계되었다.
강점
- Audex-2B는 오디오 전용 인코더와 확장된 오디오 토큰 어휘를 통합하여 텍스트-오디오 쌍방향 작업을 단일 모델에서 처리할 수 있다. 이 구조는 별도 음성-특화 모델과의 파이프라인 결합 없이 음성 인식, 번역, 생성 기능을 제공한다. 경량 2B 규모로 설계되어 상대적으로 추론 자원 요구량이 낮다는 점이 실용적 장점이다.
- vLLM과의 호환성을 염두에 둔 배포 지침을 제공하여 대규모 컨텍스트와 오디오 입출력 환경에서 실험적 재현성이 높다. README는 권장 환경(vLLM 0.20.0)과 transformers 버전 조건을 명시하고 관련 설치·실행 스크립트를 포함한다. 이로 인해 실무에서 설정 오류를 줄이고 재현성을 확보하기 용이하다.
훈련 방식
Nemotron-Cascade-2 텍스트 백본을 기반으로 다단계 SFT(multi-stage SFT)를 적용해 텍스트·오디오 기능을 점진적으로 통합하여 Audex-2B 체크포인트를 획득했으며, 상위 모델인 Audex-30B 계열에는 추가로 cascaded RL이 적용되었다.
알아두면 좋은 것
- Audex-2B는 Nemotron-Labs-Audex-30B-A3B와 동일한 설계 철학을 따르되 파라미터 수를 줄여 추론 리소스 요구량을 낮춘 경량 밀집 모델이다. 이 모델은 다단계 SFT로 학습된 상태로 공개되며, 더 큰 30B 버전은 추가적으로 cascaded RL을 거쳤다. 경량화와 동일한 훈련 레시피 적용이 핵심 배포 전략이다.
- 오디오 관련 추론은 vLLM 0.20.0 컨테이너에서 권장되며, 오디오 디코딩을 위해 추가 패키지 설치가 필요하다. README는 vLLM 기반의 오프라인 배치, OpenAI 호환 서버 방식, 그리고 transformers 기반 추론 예시를 모두 제공한다. vLLM 플러그인 설치와 XCodec 자원 준비 절차가 재현성 지침에 포함되어 있다.
- 오디오 입력 처리 파이프라인은 오디오 파일을 JSON 형식으로 전달하는 규격을 사용하며, '<sound> ' 등의 플레이스홀더로 오디오 임베딩을 삽입하는 방식을 채택한다. 텍스트 전용 레퍼런스와 호환되도록 오디오 토큰을 마스킹하거나 텍스트 전용 체크포인트로 변환하는 방법을 문서에서 제시한다. 이로 인해 동일 체크포인트로 텍스트 전용·오디오 통합 워크플로를 조정할 수 있다.
- 배포 라이선스는 NVIDIA의 one-way noncommercial 라이선스로 명시되어 있으며, 모델 사용과 배포에 제약이 있다. README에 라이선스 파일 링크가 포함되어 있고 배포 날짜는 2026-06-08로 표기되어 있다. 상업적 사용 여부는 라이선스 전문을 통해 확인해야 한다.
기술적 특징
- 오디오-텍스트 통합 구조는 오디오 인코더 → MLP 어댑터 → LLM 백본의 흐름으로 구성되어 오디오 임베딩을 텍스트 어휘 공간으로 매핑한다. 이 설계는 연속 오디오 임베딩을 기존의 토큰 기반 Transformer 입력과 호환되도록 변환하며, 텍스트 출력과 오디오 토큰 생성을 동일한 디코더 어휘에서 처리할 수 있게 한다. 따라서 오디오 입력에서 직접 오디오/텍스트 출력을 생성하는 통합 파이프라인이 가능하다.
- 확장된 이산 오디오 어휘를 도입하여 모델이 음성·일반 오디오 출력을 토큰 수준에서 직접 예측하도록 했다. 예측된 오디오 토큰은 XCodec 계열 디코더로 복원하여 실제 파형을 생성하며, 스트리밍 가능한 경로와 고품질의 비스트리밍 디코더 옵션을 모두 제공한다. 이 접근은 텍스트 기반 생성과 오디오 생성 사이의 포맷 일관성을 확보하는 데 기여한다.
- 훈련 커리큘럼은 다단계 SFT로 구성되어 각 단계에서 특정 능력을 순차적으로 추가하는 멀티스테이지 루트와 모든 태스크를 합쳐 한 번에 학습하는 통합 단일 스테이지 옵션을 모두 실험한 것으로 문서화되어 있다. Audex-2B는 다단계 SFT를 통해 오디오 관련 태스크를 점진적으로 학습했고, 더 큰 30B 모델은 SFT 후 cascaded RL을 추가 적용했다. 이런 커리큘럼 설계는 안정적으로 멀티태스크 성능을 확보하는 데 목적이 있다.
- 런타임 측면에서는 vLLM 플러그인과 특정 transformers 버전 요구사항을 명시하여 대규모 컨텍스트(최대 128K)와 오디오 입출력을 효율적으로 처리할 수 있게 했다. vLLM 컨테이너는 오디오 디코딩용 확장 패키지와 함께 사용되며, 오프라인 배치 및 OpenAI 호환 서버 방식 모두를 지원한다. 이러한 실행 가이드는 실제 배포·평가에서 성능 재현을 용이하게 한다.
차별점
- 모델은 텍스트 전용 기능을 보존하면서 오디오 입력과 출력 어휘를 직접 통합해 단일 체크포인트로 음성 이해·생성·인식·번역을 모두 처리할 수 있다.
- Audex-2B는 2B의 비교적 작은 파라미터 규모로 설계되어 동일 계열의 30B 모델보다 추론 자원 요구량이 낮다는 점을 목표로 한다.
- 공식 문서에 vLLM 중심의 구체적 배포·실행 스크립트를 제공하여 오디오 워크플로에 특화된 재현성 지침을 함께 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| context_length | max_tokens | 128K | — |
이미지 분석




69
Likes
1.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.