스트리밍 음성 인식
실시간 오디오를 입력으로 받아 연속적으로 텍스트 결과를 생성하는 처리 계층이다. 마이크에서 들어오는 음성 신호를 프레임 단위로 처리해 중간 전사 결과를 하위 모듈에 전달하며 지연을 최소화하는 것이 핵심 역할이다. 이 과정의 정확도와 응답 속도는 이후 턴 감지와 툴 호출의 신뢰성에 직접적인 영향을 미친다.