본문으로 건너뛰기

FlexiSLM: 동적이고 제어 가능한 프레임 레이트 음성 언어 모델

기존 SLM은 12.5 Hz 또는 25 Hz 같은 고정 프레임 레이트로 음성을 표현해 침묵이나 정보 희소 구간에도 동일한 연산을 소비했다. 동적 프레임 레이트는 인접 프레임 유사도를 이용해 평균 토큰 수를 줄이므로 동일한 모델로 품질과 추론 속도 사이의 절충을 가능하게 한다. FlexiSLM은 이러한 동적-가변 프레임 레이트를 입력과 출력 양쪽에 적용해 단일 모델로 4.0~12.5 Hz 범위에서 작동하고, 중간 지점인 6.25 Hz에서 12.5 Hz 대비 추론 시간을 대폭 단축하면서 음성 품질을 유지했다.

용어 해설

동적 프레임 레이트(Dynamic Frame Rate)
음성 신호를 고정된 프레임 수 대신 시간축 정보 밀도에 따라 가변적인 수의 프레임으로 인코딩하는 방식으로, 유사한 인접 프레임을 병합해 평균 프레임 수를 낮추고 계산량을 줄인다. 본문에서는 12.5 Hz 기저 표현에서 유사도 기반 병합을 수행해 평균 6.25 Hz 수준으로 압축하는 예를 중심으로 활용된다. 프레임 레이트 제어는 추론 시 품질과 속도 사이의 절충을 사용자 수준에서 직접 조절할 수 있게 한다.
프레임 병합(Frame Merging)
연속된 특징 벡터 쌍 간의 코사인 유사도를 계산해 임계값을 넘는 인접 프레임들을 그룹화하고 평균 벡터와 길이 속성으로 대체하는 알고리즘이다. 좌에서 우로 탐색하며 연속적으로 높은 유사도를 보이는 구간을 그리디 방식으로 병합하여 토큰 수를 줄인다. FlexiSLM에서는 입력 측과 FlexiCodec 내부의 토크나이저 양쪽에 동일한 병합 메커니즘을 적용해 동적-가변 프레임 표현을 만든다.
유한 스칼라 양자화(Finite Scalar Quantization (FSQ))
FlexiCodec에서 연속 특징을 유한한 정수 코드로 변환하는 양자화 방식으로, 각 병합된 프레임에 대해 FSQ 코드를 예측하고 프레임 길이 속성을 함께 저장해 재구성에 사용한다. FSQ는 RVQ와 달리 단일 스칼라 코드북 기반의 양자화 접근으로 토큰화 이후 디코딩 경로에서 멜 스펙트로그램 복원을 지원한다. FlexiSLM의 Talker는 FSQ 코드 스트림과 프레임 길이 토큰을 병렬 출력으로 예측한다.
Thinker–Talker 아키텍처(Thinker–Talker Architecture)
텍스트 이해와 의사결정은 Thinker LLM이 수행하고, 음성 토큰 예측은 Talker Transformer가 담당하는 병렬적 구조로서, Thinker의 최종 레이어 은닉 상태가 Talker의 입력으로 사용된다. Talker는 텍스트와 과거 음성 토큰을 함께 받아 FSQ와 프레임 길이를 병렬로 예측하며, 선택적으로 Talker에서 생성된 음성 임베딩을 다시 Thinker에 피드백할 수 있다. 이 구조는 음성과 텍스트를 통합해 다양한 음성 작업을 하나의 모델로 처리하도록 설계되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.