풀-듀플렉스 오디오-비주얼 상호작용
사용자와 에이전트가 동시에 발화와 시각적 행위를 주고받는 쌍방향 실시간 인터랙션 모드이다. 스트리밍 입력(텍스트, 오디오, 비디오)을 연속 단위로 처리하고 모델은 동시적으로 오디오·비디오 응답을 생성하여 타이밍과 동기화를 보장한다. 본 논문은 이 모드에서 낮은 모델 사이드 지연과 동시적 행동·발화 생성을 목표로 한다.