본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Nemotron-Labs-Audex-2B

Audex-2B는 오디오 이해, 음성 인식, 음성 번역, 텍스트-음성 합성(TTS), 텍스트-오디오 생성(TTA), 그리고 음성 간 변환(speech-to-speech) 같은 오디오 중심 태스크를 수행한다. 모델은 동일한 백본에서 텍스트 생성 능력과 오디오 토큰 예측을 결합하여 단일 추론 파이프라인으로 처리하도록 설계되었다. 또한 텍스트 전용 모드와 오디오 포함 모드(think/instruct)를 모두 지원하여 추론 제어가 가능하다.2B128K 컨텍스트nvidia-oneway-noncommercial-license

Audex-2B는 Nemotron-Cascade-2 기반의 2B 밀집 모델로서 확장된 오디오 어휘와 오디오 인코더를 결합해 음성 인식·번역·오디오 생성·TTS를 지원하면서 텍스트 추론 능력을 대체로 유지한다.

학습 방식 · Nemotron-Cascade-2 텍스트 백본을 기반으로 다단계 SFT(multi-stage SFT)를 적용해 텍스트·오디오 기능을 점진적으로 통합하여 Audex-2B 체크포인트를 획득했으며, 상위 모델인 Audex-30B 계열에는 추가로 cascaded RL이 적용되었다.

TL;DR

Audex-2B는 Nemotron-Cascade-2 텍스트 백본을 기반으로 오디오 인코더와 확장된 오디오 어휘를 통합한 2B 밀집 모델로, 다단계 SFT를 통해 오디오 이해, 음성 인식·번역, 텍스트-음성/텍스트-오디오 생성 및 음성-간 변환을 하나의 체크포인트에서 처리할 수 있도록 설계되었다. 모델은 오디오 입력을 연속 임베딩으로 변환한 뒤 MLP 어댑터로 텍스트 어휘 공간에 주입하고, 확장된 이산 오디오 토큰을 직접 예측하여 XCodec 계열 디코더로 파형을 복원하는 방식으로 동작한다. 배포는 vLLM 기반 추론을 권장하며 최대 128K 토큰 컨텍스트를 지원하므로 긴 문맥의 오디오·텍스트 혼합 작업을 처리할 수 있다. 공개 버전은 다단계 SFT로 학습된 상태이고 라이선스는 NVIDIA의 one-way noncommercial 약관을 따르며, 더 큰 30B 계열은 추가적인 cascaded RL 단계를 거쳐 성능을 보강했다.

핵심 포인트

  • 모델은 텍스트 전용 기능을 보존하면서 오디오 입력과 출력 어휘를 직접 통합해 단일 체크포인트로 음성 이해·생성·인식·번역을 모두 처리할 수 있다.
  • Audex-2B는 2B의 비교적 작은 파라미터 규모로 설계되어 동일 계열의 30B 모델보다 추론 자원 요구량이 낮다는 점을 목표로 한다.
  • 공식 문서에 vLLM 중심의 구체적 배포·실행 스크립트를 제공하여 오디오 워크플로에 특화된 재현성 지침을 함께 제공한다.
  • Audex-2B는 오디오 전용 인코더와 확장된 오디오 토큰 어휘를 통합하여 텍스트-오디오 쌍방향 작업을 단일 모델에서 처리할 수 있다. 이 구조는 별도 음성-특화 모델과의 파이프라인 결합 없이 음성 인식, 번역, 생성 기능을 제공한다. 경량 2B 규모로 설계되어 상대적으로 추론 자원 요구량이 낮다는 점이 실용적 장점이다.

벤치마크

벤치마크지표비교
context_lengthmax_tokens128K

이미지 분석

모델의 주요 벤치마크와 성능 요약을 표 형식으로 정리한 메인 결과 표 이미지이다.
이 표는 Audex 계열 및 관련 베이스라인의 다양한 평가 항목(추론, 지식, 정렬, 장기 문맥, 음성 인식, TTS 등)에 대한 수치 결과를 한눈에 비교할 수 있게 배치했다. 표에는 여러 모델과 컨텍스트 길이별 성능이 병기되어 있어 Audex-2B가 오디오 태스크와 텍스트 추론 능력을 동시에 유지하는지 확인하는 근거 자료로 사용된다. 시각적 배치상 마지막 열들이 Audex-30B/2B 계열의 오디오 성능 우위를 강조하는 형태로 구성되어 있다.
Audex 아키텍처 다이어그램으로, 오디오 인코더와 MLP 어댑터가 LLM 백본과 어떻게 연결되는지를 보여준다.
다이어그램은 오디오 입력이 오디오 인코더를 거쳐 연속 임베딩으로 변환되고 MLP 어댑터를 통해 Nemotron-Cascade 텍스트 백본의 입력으로 주입되는 플로우를 시각화한다. 또한 텍스트 토큰과 별개로 확장된 오디오 토큰이 모델 출력을 통해 직접 예측되는 구조임이 명확하게 표시되어 있으며, 이로 인해 텍스트-오디오 양방향 생성을 단일 구조에서 처리할 수 있음을 알 수 있다. 아키텍처는 기존 텍스트 LLM에 최소한의 추가 모듈로 오디오 기능을 결합하는 설계 선택을 반영한다.
다양한 상호작용 템플릿(텍스트 채팅, 오디오 QA, TTS, TTA)을 예시로 제시한 그림이다.
이미지는 모델이 사용하는 ChatML 기반 시스템/사용자/어시스턴트 토큰 구조와 오디오 플레이스홀더(<sound>, <audiogen> 등)를 실제 입력 템플릿에 어떻게 배치하는지를 구체적으로 보여준다. 오디오 QA 템플릿과 텍스트-오디오·텍스트-음성 템플릿은 입력에서 오디오 임베딩 플레이스홀더를 삽입하고 출력 단계에서 오디오 토큰을 생성하는 흐름을 명확히 한다. 이 자료는 실제 추론 파이프라인에서 JSON 입력 형식과 템플릿 사용법을 일치시키는 데 실무적 가이드를 제공한다.
Audex의 학습 파이프라인 다이어그램으로, multi-stage SFT와 단일-스테이지 통합 SFT, 그리고 cascaded RL 적용 흐름을 제시한 그림이다.
다이어그램은 두 가지 SFT 커리큘럼(멀티스테이지와 통합 단일 스테이지)을 비교하고 각 단계에서 텍스트·오디오 워밍업, 오디오 생성 SFT, 오디오 이해 SFT를 어떻게 배치하는지 보여준다. 또한 SFT 이후 Audex SFT 체크포인트를 Nemotron-Cascade-2 기반의 RL(MOPD 포함)로 캐스케이딩하여 최종 Audex를 얻는 절차를 시각화한다. 이 시퀀스는 Audex-2B가 SFT만으로 공개된 반면 상위 모델은 추가 RL 단계를 거쳤음을 명확히 한다.

69

LIKES

1.7k

DOWNLOADS

5 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.