본문으로 건너뛰기

WILDACTOR: 제약 없는 신원 보존형 비디오 생성

기존 비디오 생성 AI는 얼굴에만 집중하거나 몸의 움직임이 고정되는 한계가 있었다. 이 논문은 대규모 데이터셋과 새로운 어텐션 기법을 통해 다양한 각도와 역동적인 움직임 속에서도 인물의 전신 정체성을 완벽하게 유지하는 기술을 제시했다.

용어 해설

확산 트랜스포머(Diffusion Transformer)
확산 모델의 구조에 트랜스포머 아키텍처를 결합한 형태이다. 이미지나 비디오의 패치를 토큰으로 처리하여 대규모 데이터 학습과 고해상도 생성에 유리하며, 최근 Sora 등 최신 비디오 생성 모델의 핵심 구조로 사용된다.
신원 드리프트(Identity Drift)
비디오 생성 과정에서 프레임이 진행되거나 시점이 바뀜에 따라 인물의 얼굴 특징이나 옷의 질감이 서서히 변하는 현상이다. 이는 일관된 캐릭터성을 유지해야 하는 영상 제작에서 해결해야 할 주요 기술적 난제 중 하나이다.
포즈 잠금(Pose Locking)
참조 이미지의 자세 정보가 생성 모델에 너무 강하게 주입되어, 비디오 속 인물이 움직이지 못하고 고정된 자세만 유지하는 현상이다. 주로 신원 정보를 주입하는 과정에서 동적인 움직임 생성이 억제될 때 발생한다.
몬테카를로 샘플링(Monte Carlo Sampling)
무작위 추출을 통해 복잡한 확률 분포의 값을 근사하는 통계적 방법이다. 이 논문에서는 데이터셋 내의 시점 불균형을 해결하기 위해 특정 시점의 샘플링 확률을 동적으로 조정하는 전략으로 활용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 28.수집 2026. 03. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.