본문으로 건너뛰기
HF Daily Papers조회 1

단일 영상으로 여러 시점의 4D 사람 복원

4DAnyone은 3D skeleton, RCP, TCR을 결합해 단일 영상에서 4DGS용 다중 시점 사람 영상을 생성합니다.

용어 해설

4D Gaussian Splatting
시간에 따라 변하는 3D 장면을 Gaussian 요소들의 위치, 크기, 색상, 불투명도로 표현하고 이를 여러 시점에서 빠르게 렌더링하는 방법입니다. 이 논문에서는 생성된 다중 시점 영상을 입력으로 받아 움직이는 사람의 4D 표현을 복원하는 후속 단계에 사용합니다. 조밀한 다중 카메라 영상이 필요한 기존 구성을 단일 영상 기반 생성 결과로 대체하는 것이 핵심입니다.
비디오 Diffusion Model(Video Diffusion Model)
노이즈가 섞인 영상 잠재 표현을 여러 denoising 단계에서 점진적으로 정제해 영상을 생성하는 모델입니다. 4DAnyone은 입력 영상, 3D skeleton, 참조 영상 토큰을 조건으로 삼아 지정된 카메라 시점의 사람 영상을 만듭니다. 여러 시점의 출력이 서로 어긋나지 않아야 4D 재구성에 사용할 수 있습니다.
DiT
Diffusion 과정의 영상 토큰을 Transformer 블록으로 처리하는 구조입니다. 이 논문에서는 video attention으로 시간과 공간 정보를 처리하고 multiview attention으로 여러 시점의 관계를 교환하며 text cross-attention으로 조건을 결합합니다. 한 번의 forward pass가 처리할 수 있는 attention context가 제한되기 때문에 다수 시점 생성에서 그룹 분할 문제가 발생합니다.
Human Mesh Recovery
단일 영상에서 사람의 3D 신체 구조와 움직임을 추정하는 기술입니다. 4DAnyone은 GVHMR를 사용해 monocular 입력으로부터 3D skeleton 시퀀스를 얻고, 이를 목표 카메라 시점에 투영합니다. 조밀한 depth보다 신뢰도 높은 희소 구조 신호를 사용해 시점 변화에 따른 신체 형상과 가림 관계를 제어합니다.
Flow Matching
노이즈 분포에서 데이터 분포로 이동하는 벡터장을 학습해 생성 과정을 구성하는 방법입니다. 논문은 latent 공간에서 표준 MSE flow-matching loss를 계산하고, 복원된 frame에는 λ=0.25인 LPIPS 손실을 추가합니다. 두 손실을 함께 사용해 잠재 표현의 생성 안정성과 VAE 복원 영상의 지각적 품질을 동시에 보정합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.