본문으로 건너뛰기

streaming-speech-synthesis

스트리밍 음성 합성

스트리밍 음성 합성은 입력 텍스트를 순차적으로 처리하여 낮은 지연으로 음성을 생성하는 기술로서, 입력 버퍼가 채워지지 않은 상태에서도 중간 출력(프리뷰)을 내보내며 실시간 대화에 맞춘 타이밍 제어와 점진적 디코딩 전략이 핵심 역할을 합니다. 모델은 작은 오디오 청크를 생성하고 누적하며 출력 품질과 지연 사이의 균형을 맞춥니다.