본문으로 건너뛰기

DreamVideo-Omni: 잠재 정체성 강화 학습을 통한 옴니 모션 제어 다중 대상 비디오 커스터마이징

기존 비디오 생성 AI는 여러 인물의 정체성을 유지하면서 동시에 복잡한 움직임을 구현하는 데 어려움이 있었다. 이 논문은 인물별 특징 보존과 카메라 이동, 객체의 세밀한 동작을 하나의 프레임워크에서 동시에 정밀 제어하는 기술을 제시하여 실사급 비디오 편집의 실무 활용도를 획기적으로 높였다.

용어 해설

확산 트랜스포머(DiT)
기존의 U-Net 구조 대신 Transformer 아키텍처를 Diffusion 모델의 백본으로 사용하는 설계이다. 데이터의 장거리 의존성을 더 잘 파악하고 모델 크기 확장에 유리하여 고화질 비디오 생성에 널리 쓰인다.
회전 위치 임베딩(RoPE)
토큰의 위치 정보를 벡터의 회전 변환을 통해 인코딩하는 기법이다. 상대적인 위치 관계를 효과적으로 학습할 수 있게 하며, 비디오의 시공간적 일관성을 유지하는 데 중요한 역할을 한다.
잠재 공간(Latent Space)
고차원 데이터(이미지, 비디오)를 압축하여 핵심 특징만을 남긴 저차원 벡터 공간이다. 이 공간에서 연산을 수행하면 계산 효율성이 극대화되며 추상적인 특징 제어가 용이해진다.
지도 미세 조정(SFT)
사전 학습된 모델을 특정 데이터셋과 레이블을 사용하여 추가 학습시키는 과정이다. 이 논문에서는 인물의 외형과 움직임 신호를 연결하기 위한 첫 번째 학습 단계로 활용된다.
보상 모델(Reward Model)
모델의 출력이 인간의 선호도나 특정 기준에 얼마나 부합하는지 점수를 매기는 별도의 모델이다. 강화 학습 과정에서 생성 모델이 더 나은 결과물을 만들도록 가이드하는 역할을 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 13.수집 2026. 03. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.