TL;DR
음성-언어를 하나의 멀티모달 표현 공간으로 매핑하고 운용-regime를 데이터/목표/디코딩 제약으로 분리한다. RLHF 중심의 정렬과 특정 디코딩 기법으로 ASR, TTS, Realtime의 서로 다른 배포 목표를 하나의 백본에서 달성하며, SOTA 성능과 효율성을 동시에 달성한다.
왜 중요한가
음성-언어를 하나의 멀티모달 표현 공간으로 매핑하고 운용-regime를 데이터/목표/디코딩 제약으로 분리한다. RLHF 중심의 정렬과 특정 디코딩 기법으로 ASR, TTS, Realtime의 서로 다른 배포 목표를 하나의 백본에서 달성하며, SOTA 성능과 효율성을 동시에 달성한다.
핵심 기여
통합 음성-언어 백본의 배포-regime별 특화
공유 백본 위에 ASR, TTS, Realtime의 세 가지 운용 목표를 도입하고, RLHF 중심의 정렬과 특화 디코딩으로 각 능력을 달성한다.
verifiable multi-token decoding (MTP) 도입
ASR 디코더에 MTP 헤드를 도입해 한 스텝에서 다수의 미래 토큰을 제안하고, 검증된Prefix에서만 채택하는 방식으로 디코딩을 가속화한다.
TTS의 semantic-to-audio 정렬 및 제어
텍스트-오디오 표현 공간 간 정렬을 강화하고, 글로벌/인라인 지시를 반영하는 RLHF 기반의 음성 합성을 학습한다. 제로샷 보이스 클로닝과 고품질 데이터로 컨트롤 가능성을 확보한다.
Realtime에서의 대화적 저지연성 및 페르소나 안정성
RLHF 기반의 Generative Reward Model과 상호작용 루브릭으로 페르소나 유지 및 파라링구스틱 반응을 개선한다.
공통 데이터 엔진과 단계적 Foundation Pretraining
음성-이해, TTS, 대화 데이터를 함께 다루는 자동 데이터 생산 파이프라인과 3단계(Alignment, multimodal warmup/main cooldown) 학습 커리큘럼으로 백본의 학습을 주도한다.
표준 벤치마크에서의 SOTA 도달
ASR, TTS, Realtime에서 각각의 벤치마크에서 상태 최강 성능을 달성하고, MTP 도입으로 디코딩 효율이 향상된다.
핵심 아이디어 이해하기
공유 멀티모달 표현 공간을 통해 downstream 태스크의 차이를 아키텍처가 아니라 데이터/목표/디코딩 제약으로 정렬한다. 따라서 ASR은 음향 증거로부터 텍스트를 생성하고, TTS는 텍스트-음향 매핑으로 음성을 생성하며, Realtime은 음성 인식-추론-생성을 저지연으로 연결한다. RLHF를 중심으로 한 정렬은 세 가지 배포 목표를 모두 만족시키는 핵심 메커니즘이다. MTP는 디코딩의 병렬화를 가능하게 하여 토큰 단위의 대기 시간을 줄이고, Grounding(음향 기반 정보)을 통해 제어 가능한 TTS와 빠른 음성 인터랙션을 실현한다. 전체 커리큘럼은 3단계의 데이터/학습/미세조정으로 구성되며, 고품질의 긴-context 데이터로 백본의 컨텍스트 관리 능력을 강화한다.
관련 Figure

해당 그림은 StepAudio 2.5의 핵심 아이디어인 '공유 백본'을 직관적으로 전달한다. 세 가지 출력(ASR, TTS, Realtime)이 동일한 Embedding Layer와 LL M Head를 공유한다는 점을 명확히 하여, 하드웨어/데이터 관점의 효율성을 강조한다.
공유 음성-언어 백본의 구조를 보여주는 다이어그램으로, Audio Encoder→Adapter→LLM Decoder의 흐름과 ASR/TT S/Realtime가 공통 스택 위에서 분화되는 것을 시각화한다.
방법론
전체 접근 방식은 음향 인코더-어댑터-LLM 디코더 구조를 중심으로 한다. 음향 인코더는 파형에서 추출한 시퀀스 특성을 고정된 잠재 표현으로 매핑하고, 어댑터는 이를 텍스트 LLM의 숨겨진 공간으로 변환한다. 디코더는 텍스트 토큰과 음향 토큰이 공존하는 통합 시퀀스 공간에서 동작한다. ASR에서는 MTP 헤드가 각 위치 t에서 xt+1과 xt+1+h를 예측하는 6-token 프롬프트를 생성하고, 검증된 prefix에서만 수용한다(정확성 유지). 학습은 3단계로 진행된다: (1) 3B ASR 토큰으로 음성-텍스트 공간 정렬; (2) 128B warmup과 800B 토큰의 텍스트/음성 멀티모달 메인 훈련(시퀀스 길이 16K); (3) cooldown 단계에서 600B 고품질 데이터와 32K 시퀀스 확장. SFT 데이터로 100K 시간의 짧은 샘플과 50K 시간의 긴 샘플을 사용하며, RO V ER 기반 다중 시스템 어노테이션 및 LLM 기반 refine 스텝으로 QI를 높인다. TTS는 텍스트-오디오 정렬을 통해 음성 생성에 초점을 두고, RLHF를 통해 복잡한 지시/맥락에 따른 컨트롤을 강화한다. Realtime은 대화형 파라링구스틱 신호를 반영하기 위한 3단계 학습 프로세스(중간 학습, 다층 SFT, RLHF)로 구성된다. 실험은 AISHELL-1, AISHELL-2, LibriSpeech 등 다국어/롱폼 벤치마크에서 성능을 확인하고, RT-효율성(RTF)과 MTP의 수렴 특성을 분석한다.
관련 Figure

데이터 생산 파이프라인의 구체적 흐름을 제시하여, SFT 및 RLHF를 위한 신호의 품질 관리 작업을 구체적으로 드러낸다.
Long-form ASR 데이터 파이프라인으로, 단일 클립이 글로벌 세션 수준으로 확장되면서 RO V ER 등 다중 시스템의 합의 기반 라벨링 흐름을 보여준다.
주요 결과
주요 벤치마크에서 StepAudio 2.5는 ASR에서 중국어 벤치에서 CER 평균 2.97%를 달성하고, AISHELL-1에서 0.71%, FLEURS zh에서 2.63%를 기록했다. 영어 벤치마크의 평균 WER은 3.68%, 긴 형식 벤치마크의 평균은 3.70%였다. 디코딩 효율은 0.0053 RT F로, 동일 조건의 Baseline보다 빠르며, MTP-5에서 평균 수용 길이가 5.0/6로 확인되었다. 또한 2.5-TTS는 Arena 평가에서 MiniMax-2.8-HD 대비 63.0%의 승률, ElevenLabs-v3 대비 80.0%, Gemini-3.1-flash-tts 대비 59.4%의 승률을 기록했고, 전체 Arena 승률은 69.1%에 이른다. Realtime는 다섯 가지 평가 스위트에서 경쟁사 대비 일관적으로 우수하며, 주관식 인간 평가에서 +10.0의 이익, Step-SPQA에서 +16.6의 이익을 보였다. 이로써 StepAudio 2.5가 ASR, TTS, Realtime에서 SOTA에 근접하거나 이를 상회하는 성능과 효율성을 동시에 달성했음을 보인다.
관련 Figure

TTS의 비교 평가에서 63.0%, 80.0%, 59.4%의 승률 차이를 제시하며, 제로샷/인라인 지시가 성능에 미치는 영향을 시각적으로 보여준다.
Arena 평가에서 StepAudio-2.5-TTS의 승률 비교 그림

실시간 대화에서의 주관적/객관적 평가를 종합한 결과를 제시하며, StepAudio 2.5 Realtime의 전반적 우수성을 뒷받침한다.
Realtime 평가의 다섯 가지 평가 스위트에 대한 점수 그래프
기술 상세
아키텍처는 Shared Encoder-Adapter-LLM Decoder 구조이다. ASR에서 MTP 모듈은 5개의 미래 토큰을 병렬로 제안하고, 각 위치에서 pt와 pt,h의 분포를 이용해 Lt = CE(pt, xt+1) + sum_h wh CE(pt,h, xt+1+h)로 손실을 계산한다. MTP 헤드의 가중치는 h에 대해 기하적 감소를 적용하며, 첫 번째 위치의 수용률은 브랜치 수에 거의 영향을 받지 않는다. 학습은 3단계로 구성된다: (1) 3B ASR 토큰 데이터로 음성-텍스트 간 인터페이스를 맞춤; (2) 멀티모달 메인 훈련(텍스트 800B, 음성 800B, 시퀀스 길이 16K, MoE 라우터 학습률 조정 포함); (3) cooldown 단계에서 600B의 고품질 데이터로 32K 길이까지 확장. 데이터는 Short-form 100K 시간의 음성 샘플, Long-form 50K 시간의 샘플로 구성되며, RO V ER을 통한 다중 시스템 보정 및 LLM 정밀화로 품질을 보장한다. TTS는 텍스트-오디오의 정합성에 중점을 두고 RLHF를 통해 지시-맥락을 반영한 음성 합성을 학습한다. Realtime은 대화 흐름과 페르소나를 유지하는 다중 턴 학습, 파라링구틱 신호를 반영하는 학습, RLHF를 통한 상호작용 루브릭으로 구성된다.
관련 Figure

ASR 디코딩의 가속화를 설명하는 핵심 다이어그램으로, 각 MTP 블록이 6-token 프롬프트를 만들고 검증 경로를 통해 수용하는 원리를 시각적으로 제시한다.
ASR 모듈의 MTP 아키텍처를 보여주며, MTP 모듈 1과 2의 헤드가 각각 다른 시점을 예측하고 LM Head와 공유 가중치를 사용한다.
실무 활용
StepAudio 2.5는 하나의 백본으로 ASR, TTS, Realtime를 운영 체제로 구현하는 실용적 가능성을 보여준다. RLHF 기반 정렬과 디코딩 최적화로 다중 태스크를 균형 있게 제공한다.
- 실시간 음성 대화 에이전트에서 낮은 지연과 일관된 페르소나를 유지
- 다국어 ASR/TTS 시스템의 통합 음성 서비스
- 음성 기반 고객상담 로봇 및 차량용 인포테인먼트 시스템
코드 공개 여부: 비공개
키워드
용어 해설
- MTP
- — 다음 토큰 후보를 복수 단계로 예측하는 확장 디코딩 기법으로, ASR에서의 디코딩 속도 향상에 기여한다. 주 디코딩 경로를 보완하기 위한 보조 분기로 작동하며, 최종적으로는 검증된 경로를 통해 정확성을 유지한다.
- ROVER
- — 다수의 ASR 시스템 출력 결과를 투표 방식으로 결합하여 오류를 줄이는 후처리 기법이다. 다중 시스템 간 합의 기반으로 품질 신호를 확보한다.
- MoE
- — 다수의 전문가 모듈을 사용해 서로 다른 입력 특성에 특화된 표현을 학습하는 구조로, 대규모 멀티모달 모델에서 파라미터 효율을 높이고 다양한 입력에 적응한다.
- VAD
- — 음성 구간과 무음 구간을 구분하는 신호 처리 기법으로, 데이터 품질 관리 및 샘플링에 활용된다.
- SED
- — 오디오에서 소리 이벤트를 식별하는 기법으로, 노이즈 구간 제거 및 세그먼트 품질 향상에 기여한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.