본문으로 건너뛰기

StepAudio 2.5 기술 보고서

음성-언어를 하나의 멀티모달 표현 공간으로 매핑하고 운용-regime를 데이터/목표/디코딩 제약으로 분리한다. RLHF 중심의 정렬과 특정 디코딩 기법으로 ASR, TTS, Realtime의 서로 다른 배포 목표를 하나의 백본에서 달성하며, SOTA 성능과 효율성을 동시에 달성한다.

용어 해설

Multi-token Prediction(MTP)
다음 토큰 후보를 복수 단계로 예측하는 확장 디코딩 기법으로, ASR에서의 디코딩 속도 향상에 기여한다. 주 디코딩 경로를 보완하기 위한 보조 분기로 작동하며, 최종적으로는 검증된 경로를 통해 정확성을 유지한다.
Recognizer Output Voting Error Reduction(ROVER)
다수의 ASR 시스템 출력 결과를 투표 방식으로 결합하여 오류를 줄이는 후처리 기법이다. 다중 시스템 간 합의 기반으로 품질 신호를 확보한다.
Mixture-of-Experts(MoE)
다수의 전문가 모듈을 사용해 서로 다른 입력 특성에 특화된 표현을 학습하는 구조로, 대규모 멀티모달 모델에서 파라미터 효율을 높이고 다양한 입력에 적응한다.
Voice Activity Detection(VAD)
음성 구간과 무음 구간을 구분하는 신호 처리 기법으로, 데이터 품질 관리 및 샘플링에 활용된다.
Sound Event Detection(SED)
오디오에서 소리 이벤트를 식별하는 기법으로, 노이즈 구간 제거 및 세그먼트 품질 향상에 기여한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 22.수집 2026. 05. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.