본문으로 건너뛰기

Motion-Omni의 음성·전신 동작 공동 생성

Motion-Omni는 음성을 만드는 hidden states에서 얼굴·손·상체·하체 동작을 함께 생성해 RTF 0.78과 2.62% WER를 기록했다.

용어 해설

음성 동작 모델(Spoken Motion Model)
대화 문맥을 입력받아 음성 응답과 그에 맞는 동작을 함께 생성하는 모델입니다. 이 논문에서는 얼굴 표정, 손, 상체, 하체 움직임을 음성의 의미와 시간 정보에 맞춰 산출합니다. 음성을 먼저 만든 뒤 동작을 생성하는 Cascade와 달리 두 출력 경로를 공동 학습합니다.
의사 라벨링(Pseudo-labeling)
사람이 직접 주석을 달지 않고 기존 Teacher 모델의 출력을 학습 라벨로 사용하는 방법입니다. Motion-Omni는 일관된 음성의 응답 파형에 LOM을 적용해 얼굴·전신 동작 코드를 생성하고, 품질 점수로 학습 순서를 정합니다.
벡터 양자화 변분 오토인코더(VQ-VAE)
연속적인 신호를 제한된 코드북의 이산 코드로 압축했다가 복원하는 구조입니다. 이 논문에서는 LOM의 얼굴·손·상체·하체별 코드북이 동작을 256개 코드 중 하나씩으로 표현하며, Motion Generator가 예측한 코드를 SMPL-X와 FLAME 파라미터로 복원합니다.
실시간 계수(Real-Time Factor)
응답 생성에 걸린 시간을 사용자 발화 시간으로 나눈 값입니다. RTF가 1보다 작으면 발화가 끝난 뒤 실제 시간보다 짧게 응답을 생성했다는 뜻이며, Motion-Omni-Q7은 0.78을 기록해 음성과 동작을 함께 실시간보다 빠르게 생성합니다.
비트 상관도(Beat Correlation)
음성의 리듬 변화와 신체 동작의 시간적 변화가 얼마나 맞물리는지 측정하는 지표입니다. 음성에서 추출한 박자 정보와 동작 속도 변화를 비교해 계산하며, 값이 높을수록 말의 리듬에 맞춰 동작이 발생하는 정도가 큽니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 09. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.