실시간 TTS
입력 텍스트를 짧은 대기 시간으로 음성으로 변환하는 운용 모드로서 인코딩·디코딩 지연을 최소화하는 설계가 필요하다. 모델은 낮은 레이턴시를 위해 스트리밍 인퍼런스와 캐시된 오디오 프레임 출력을 사용하며 연산량을 줄이기 위해 모델 경량화 또는 효율적 디코더를 채택한다. 리더보드의 'Real-time' 표기는 해당 모델이 저지연 응답을 목표로 설계되었음을 의미한다.