본문으로 건너뛰기

multimodal-synthesis

멀티모달 합성

텍스트·음성·영상 등 서로 다른 형태의 신호를 결합해 단일 완성물로 만드는 기술이며 입력 텍스트를 음성·표정·배경 영상으로 변환하는 여러 모듈을 조합해 동작한다. 각 모듈은 별도 모델(예: TTS, talking-head, video renderer)에 텍스트나 임베딩을 전달하고 모듈 출력물을 후처리와 타임라인 동기화로 합성하는 처리 파이프라인을 사용한다고 알려져 있다. 모듈 간 시간적 동기화와 스타일 일관성 확보가 핵심 문제로 남아있음이 확인됐다.