TL;DR
오디오와 텍스트를 같은 생성 루프에서 처리하는 모델 설계는 음성 인식, 번역, 합성, 생성과 같은 서로 다른 오디오 태스크를 하나의 아키텍처로 통합할 수 있는 기반을 마련한다. Audex는 오디오 입력을 텍스트 임베딩 공간으로 투사하고 양자화된 오디오 토큰을 텍스트 토큰과 동일하게 취급함으로써 멀티모달 간의 표현 불일치를 줄였다. 이로 인해 기존의 별도 인코더·디코더 체계보다 표준 LLM 훈련·추론 인프라를 재사용하면서 다양한 오디오-텍스트 작업에서 성능을 확보할 수 있다.
왜 중요한가
오디오와 텍스트를 같은 생성 루프에서 처리하는 모델 설계는 음성 인식, 번역, 합성, 생성과 같은 서로 다른 오디오 태스크를 하나의 아키텍처로 통합할 수 있는 기반을 마련한다. Audex는 오디오 입력을 텍스트 임베딩 공간으로 투사하고 양자화된 오디오 토큰을 텍스트 토큰과 동일하게 취급함으로써 멀티모달 간의 표현 불일치를 줄였다. 이로 인해 기존의 별도 인코더·디코더 체계보다 표준 LLM 훈련·추론 인프라를 재사용하면서 다양한 오디오-텍스트 작업에서 성능을 확보할 수 있다.
핵심 기여
단일 Transformer 디코더 기반의 오디오-텍스트 통합 아키텍처
Audex는 오디오 입력을 인코더로 처리한 뒤 텍스트 임베딩 공간으로 투사하고, 텍스트 토큰과 양자화된 오디오 출력 토큰을 동일한 생성 루프로 취급하는 단일 Transformer 디코더 아키텍처를 채택했다. 이 설계는 멀티모달 융합을 간소화해 텍스트 전용 LLM 인프라를 그대로 활용할 수 있게 한다. 그 결과 텍스트 기반 능력과 오디오 관련 능력을 동시에 확보할 수 있는 기반이 형성되었다.
대규모 오디오·텍스트 코퍼스 선별 및 멀티스테이지 학습 데이터 구성
연구진은 157.4B 오디오 토큰과 320.5B 텍스트 토큰으로 구성된 정교한 오디오-텍스트 데이터셋을 마련했다. 이 대규모 데이터는 오디오 이해와 생성 능력을 동시에 학습시키기 위해 정제·조합되었다. 대량의 양질 데이터 확보로 멀티모달 표현 학습의 기반이 구축되었다.
감독학습 후 텍스트 기반 Cascade RL과 온정책 증류를 결합한 훈련 파이프라인
훈련은 다단계로 설계되어 먼저 감독학습으로 기초 능력을 확보한 뒤 텍스트 전용 Cascade RL을 적용하고 마지막으로 다중 도메인 온정책 증류를 수행했다. 이 순차적 최적화 방식은 텍스트 기반 정렬 성능을 보전하면서 오디오 태스크에 특화된 능력을 고도화하는 목적을 지녔다. 단계별로 서로 다른 손실과 데이터 분포를 사용해 모델의 전반적 일관성과 성능을 유지했다.
다양한 오디오-텍스트 과제에서의 최고 성능 달성 및 모델 체크포인트 공개
초록에서는 Audex가 오디오 이해, 음성 인식·번역, 텍스트-투-스피치, 오디오 생성, 스피치-투-스피치 생성에서 state-of-the-art 성능을 달성했다고 보고했다. 동시에 Nemotron-Cascade-2-30B-A3B 기반의 텍스트 능력인 추론력·정렬·지식·장문 컨텍스트 유지 능력이 거의 또는 전혀 저하되지 않았다고 명시했다. 연구진은 모델 체크포인트를 공개해 후속 연구와 검증을 가능하게 했다.
핵심 아이디어 이해하기
멀티모달 오디오-텍스트 문제의 출발점은 오디오와 텍스트가 서로 다른 표현 공간에 존재한다는 점이다. 텍스트는 토큰 임베딩의 이산 시퀀스로, 오디오는 연속 신호에 기반한 스펙트럼·특징 행렬로 표현되며 이 둘을 직접 결합하면 표현 불일치와 생성 루프의 비효율이 발생한다. 따라서 동일한 생성 엔진으로 두 모달리티를 처리하려면 오디오 표현을 텍스트 생성 루프가 이해할 수 있는 형태로 변환하는 명확한 매핑이 필요하다.
방법론
전체 접근 방식은 오디오를 전용 인코더로 처리한 뒤 그 출력을 텍스트 임베딩 공간으로 선형 투사하거나 다른 매핑으로 정렬해 단일 Transformer 디코더가 텍스트 토큰과 오디오 토큰을 동일하게 소비하고 생성하도록 만드는 것이다. 이 과정에서 오디오 출력은 양자화된 토큰 형식으로 변환되어 디코더의 자기회귀 생성 루프에서 텍스트 토큰과 동일한 방식으로 예측 대상이 된다. 훈련 파이프라인은 먼저 대규모 감독학습으로 기초 멀티모달 능력을 얻고 이후 텍스트 전용 Cascade RL로 정렬된 행동을 강화하며 마지막으로 온정책 증류를 통해 여러 도메인에서의 예측 분포를 학생 모델로 안정적으로 이전했다.
주요 결과
초록에 따르면 Audex는 오디오 이해, 음성 인식 및 번역, 텍스트-투-스피치, 오디오 생성과 스피치-투-스피치 생성 분야에서 state-of-the-art 성능을 달성했다고 보고되었다. 또한 Nemotron-Cascade-2-30B-A3B 기반의 텍스트 능력인 추론력, 정렬, 지식, 장문 컨텍스트 유지 능력이 거의 또는 전혀 저하되지 않았다고 명시되어 있다. 모델 체크포인트 공개는 외부 연구자가 성능을 재현하고 추가 실험을 수행할 수 있는 근거를 제공한다.
기술 상세
모델 아키텍처는 Nemotron-Cascade-2-30B-A3B라는 강력한 텍스트 전용 MoE LLM을 기반으로 삼아 단일 Transformer 디코더를 유지하면서 오디오 입력을 통합하는 형태를 취했다. 핵심 메커니즘은 오디오 인코더가 추출한 특징을 텍스트 임베딩 공간으로 투사하고, 출력 측에서는 오디오를 양자화된 토큰으로 처리해 디코더가 텍스트 토큰과 동일한 방식으로 처리·생성하게 하는 것이다. 이 접근은 텍스트 전용 LLM의 토큰 생성 루틴, 토큰 분포 모델링, 및 사후처리 파이프라인을 재사용할 수 있게 해 인프라 호환성을 확보했다.
실무 활용
Audex의 단일 생성 루프 설계는 음성 인식·번역·합성·생성을 하나의 모델로 통합해 서비스 운용에서 모델 파이프라인 단순화를 가능하게 한다. 공개된 체크포인트는 연구와 프로덕션 전환을 위한 출발점을 제공하므로 멀티태스크 오디오 시스템 개발 시간을 단축할 근거가 된다. 대규모 데이터와 단계적 훈련 절차는 실제 도메인 데이터로 추가 미세조정할 때 강력한 기반이 된다.
- 멀티언어 음성 인식과 바로 연결되는 다중언어 음성번역 파이프라인 구축
- 텍스트와 오디오를 동시에 입력으로 받는 멀티모달 대화형 에이전트의 백엔드로 활용
- 고품질 텍스트-투-스피치와 음성 변환을 결합한 콘텐츠 제작 도구
- 연구 목적으로 오디오-텍스트 표현 간 전이 학습 및 증류 실험에 사용
코드 공개 여부: 공개
키워드
용어 해설
- Mixture of Experts
- — Mixture of Experts는 네트워크의 일부 전문가 블록만 활성화하여 계산 효율을 높이는 구조이다. 입력마다 서로 다른 전문가 서브넷을 선택해 연산을 분산시키고 파라미터 수를 크게 늘리면서도 추론 비용은 일부만 증가시키는 방식으로 작동한다. 대규모 LLM에서 용량과 비용의 균형을 맞추기 위해 MoE가 채택되는 사례가 많다.
- Transformer Decoder
- — Transformer 디코더는 자기회귀적 토큰 생성을 위해 causal attention과 feed-forward 블록을 사용하는 구조이다. 입력 임베딩을 순차적으로 처리하면서 이전 토큰에 대한 컨텍스트를 반영해 다음 토큰 확률을 출력한다. 텍스트 생성 모델과 통합 생성 파이프라인에서 디코더 단일화는 멀티모달 토큰을 동일한 생성 루트로 결합하는 핵심 수단이다.
- On-policy Distillation
- — On-policy Distillation은 에이전트가 실제 정책으로 생성한 동작·출력을 교사로 삼아 학생 모델을 학습시키는 기법이다. 정책이 생성한 행동 분포를 그대로 모사하도록 손실을 설계해 배포 시 행동 일관성을 확보한다. 멀티도메인 및 RL 후속 학습 단계에서 안정성과 성능 보존을 위해 사용된다.
- Cascade RL
- — Cascade RL은 여러 단계의 보상 기반 최적화 과정을 순차적으로 적용해 모델 능력을 단계별로 강화하는 접근이다. 텍스트 기반 정책 최적화 후 멀티모달 특화 단계로 이어지는 형태가 논문에서 채택되며, 각 단계는 상위 성능을 유지하면서 특정 역량을 향상시키는 목적을 가진다. 대규모 LLM의 정렬과 성능 유지에 유효한 방법론으로 쓰인다.
- Quantized Audio Tokens
- — 양자화 오디오 토큰은 연속적 오디오 신호를 이산 토큰으로 변환한 표현이다. 오디오 인코더가 추출한 특징을 토큰화·양자화해 텍스트 토큰과 동일한 생성 인터페이스로 입력하거나 출력하도록 만드는 것이 핵심이다. 이 방법은 오디오 생성 및 변환을 텍스트 기반 생성 루프로 통합하는 데 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

