본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

AntResearch/4DAnyone

단안 영상을 다중 시점 영상으로 변환해 4D 인체 재구성을 지원하는 video-to-video 생성multiple-licenses

단안 인물 영상을 여러 시점의 영상으로 바꿔 4DGS 재구성에 연결하는 video-to-video 모델

TL;DR

4DAnyone은 특정 base model이나 fine-tuning 방식이 README에 명시되지 않은 video-to-video 생성 모델로, casual monocular video를 다중 시점 영상으로 변환합니다. model.safetensors를 중심으로 Wan2.2 VAE와 UMT5-XXL text encoder를 사용하고, GVHMR·ViTPose-H·YOLOv8X로 인체와 자세 정보를 처리하는 구성입니다. 생성된 multiview video는 4DGS reconstruction과 novel-view synthesis의 입력으로 이어집니다. 공개 문서에는 정량 벤치마크와 추론 성능 수치가 없습니다.

핵심 포인트

  • 4DAnyone은 casual monocular video 한 편을 입력으로 받아 사람의 여러 시점 영상을 생성합니다. 이렇게 얻은 영상은 후속 4DGS reconstruction의 입력으로 활용됩니다. README에는 특정 base model이나 fine-tuning 방식이 명시되지 않았습니다.
  • 구성 파일에는 model.safetensors와 Wan2.2_VAE.pth, UMT5-XXL text encoder가 포함됩니다. GVHMR, ViTPose-H, YOLOv8X가 영상 속 인체와 자세를 처리하는 보조 구성으로 함께 제공됩니다. 입력 영상에서 인체 정보를 추출한 뒤 시점이 바뀐 프레임을 생성하는 흐름입니다.
  • 단일 카메라 영상만으로 novel-view synthesis와 multiview video generation을 수행하는 점이 핵심입니다. 별도의 다중 카메라 촬영 없이 4D human reconstruction에 필요한 시점별 영상을 확보하도록 설계됐습니다. 공개 README에는 정량 벤치마크나 처리 속도 수치가 없습니다.

제한사항

  • README는 casual monocular video를 입력 범위로 제시하며, 다중 카메라 입력이나 다른 형태의 데이터 지원 여부는 밝히지 않습니다. 따라서 제공된 문서만으로는 복잡한 촬영 조건에서의 적용 범위를 판단하기 어렵습니다. 후속 활용 대상도 4DGS reconstruction으로 명시돼 있습니다.
  • 저장소에는 Wan2.2_VAE, UMT5-XXL, GVHMR, ViTPose-H, YOLOv8X 등 여러 자산이 함께 포함됩니다. 라이선스는 자산별로 다르며, 정확한 사용 범위는 LICENSE와 licenses 디렉터리에서 별도로 확인해야 합니다. 모델 전체를 단일 라이선스로 취급하기 어렵습니다.

이미지 분석

단안 원본 영상의 인물 장면과 생성된 다양한 시점의 인물 영상을 나란히 배치한 teaser 이미지입니다.
이미지는 Source Video로 표시된 원본 장면과 여러 인물의 시점·자세·배경이 달라진 결과 프레임을 함께 배치해, 한 영상에서 다중 시점 영상을 만드는 작업 흐름을 시각화합니다. 이는 4DAnyone의 multiview video generation과 novel-view synthesis 목적을 직접 보여주며, 후속 4DGS reconstruction에 필요한 시점 정보가 어떻게 확장되는지 전달합니다.

71

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.