TL;DR
고품질 4D 헤드 아바타를 얻기 위해 선행 연구는 일반화 가능한 feed-forward와 개별 아이덴티티를 보장하는 per-subject refinement를 분리해 왔다. SpatialAvatar-0은 두 가지 모드의 Gaussian 표현을 공유된 FLAME- mesh-bound 공간에서 통합하고, monocular-temporal → multi-view-spatial 두 단계 학습 및 10Kiter의 레이아웃 보존형 per-subject refinement를 통해 identity-prior collapse를 억제한다. VFHQ/HDTF에서 cross-domain zero-shot 성능이 향상되고, SplattingAvatar 벤치마크에서 단일 프레임 입력으로도 고주파 디테일이 유지되며, per-subject 재구성은 약 2분 내로 완료된다. 이를 통해 피처 재구성의 일반화와 주제별 재현성을 하나의 파이프라인으로 연결한다.
왜 중요한가
고품질 4D 헤드 아바타를 얻기 위해 선행 연구는 일반화 가능한 feed-forward와 개별 아이덴티티를 보장하는 per-subject refinement를 분리해 왔다. SpatialAvatar-0은 두 가지 모드의 Gaussian 표현을 공유된 FLAME- mesh-bound 공간에서 통합하고, monocular-temporal → multi-view-spatial 두 단계 학습 및 10Kiter의 레이아웃 보존형 per-subject refinement를 통해 identity-prior collapse를 억제한다. VFHQ/HDTF에서 cross-domain zero-shot 성능이 향상되고, SplattingAvatar 벤치마크에서 단일 프레임 입력으로도 고주파 디테일이 유지되며, per-subject 재구성은 약 2분 내로 완료된다. 이를 통해 피처 재구성의 일반화와 주제별 재현성을 하나의 파이프라인으로 연결한다.
핵심 기여
K-source 변동 가능한 feed-forward Gaussian 생성기
K 소스 포즈를 입력으로 받아 파라미터가 없는 mean-pool링으로 각 UV 픽셀의 Gaussian 속성을 예측하는 feed-forward 제너레이터를 구성하고, monocular- Temporal → multi-view-spatial 두 단계 학습 일정에 의해 단일 소스와 다중 소스를 모두 다룰 수 있게 한다.
10×10K Iter의 layout-preserving per-subject refinement 루프
FLAME 바인딩과 Gaussian 카운트를 고정하고, densification을 제거한 채 per-가우시안 속성을 10K iterations × 10의 루프에서 재구성한다. 세 가지 anti-spike 정규화로 anisotropy spike를 제어한다.
교차 도메인 및 per-subject 평가로 SOTA를 상회
VFHQ/HDTF의 cross-domain zero-shot에서 in-domain leader를 +1.5 dB PSNR 초과, SplattingAvatar monocular 벤치마크에서 모든 지표에서 상향. per-subject 벤치마크에서 GeoAvatar 대비 +1.3 dB PSNR 개선 및 30×~60× 더 짧은 학습 스케줄.
핵심 아이디어 이해하기
단계적 관점에서 본 논문 아이디어는 다음과 같다. 1) 3D Gaussian Splatting은 렌더링 효율성과 기하 정밀도 사이의 균형을 제공하지만, 단일 네트워크에 monocular-와 multi-view- supervison을 함께 사용하면 도메인 바이어스가 증가한다. 2) SpatialAvatar-0은 FLAME 매시 바운드 Gaussian 표현을 공유하고, feed-forward와 per-subject refinement가 하나의 구조에서 작동하도록 구성한다. 3) 두 가지 모드의 학습은 monocular-temporal과 multi-view-spatial의 two-phase schedule로 연결되며, identity-prior의 붕괴를 방지하기 위한 L2-SP anchor와 cross-time mix로 안정성을 확보한다. 4) per-subject refinement는 densification 없이 가우시안 구성을 보존하고 anti-spike 정규화를 포함하여 고주파 디테일의 재현성을 유지한다.
방법론
단계별 구성은 아래와 같다. - 전체 아키텍처: Stage 1 feed-forward와 Stage 2 per-subject refinement로 구성된 이원 구조이며, 동일 FLAME- mesh-bound Gaussian 표현을 사용한다. - Stage 1 아키텍처: 고정된 DINOv3 ViT-B/16 백본으로 dense feature map과 CLS 토큰을 생성하고, UV 공간으로 바리센트 워프한 후 StyleUNet으로 UV 출력(32×32 채널) 및 27 차원의 harmonic embedding γ(d)으로 target 방향을 인코딩한다. K>1인 경우 입력 소스들을 mean-pool하여 고정 파라미터의 집합으로 처리한다. FLAME 바인딩은 Qian et al.의 트래커를 통해 얻는다; UV-픽셀당 Gaussian 배열을 유지하고, Stage 2에서 고정한다. - Stage 1 학습: Phase 1은 CelebV-HQ에서 monocular-temporal 사전학습, Phase 2는 NeRSemble에서 multi-view-spatial 후학습으로 진행된다. Phase 2는 Phase 1 체크포인트에 대한 L2-SP anchor를 적용하고 cross-time mix를 도입한다. - Stage 2 최적화: per-subject refinement는 10K iterations로 구성되며, 샘플 프레임은 랜덤 target 프레임으로 설정하고 FLAME 메쉬를 변형시켜 Gaussian들을 Eq. 1에 따라 world 좌표로 매핑한다. Densification은 제거되고, 거짓 정렬 문제를 막기 위한 anti-spike 정규화(스케일 프리스 워밍업, 로그 스케일 클램프, 화면 공간 anti-anisotropy 페널티)가 적용된다. - 손실 함수: photometric( L1, MS-SSIM, LPIPS), face 영역의 L1, UV-domain TV(포지션 및 스케일), 출력 공간 L1 shrinkage, Jacobian 제약(Jac), 구성적 제약(Jac) 등을 합친 다항식으로 구성한다. - Jacobian 제약: per-pixel view-direction invariance를 위해 Hutchinson 랜덤 벡터를 이용한 근사치를 통해 Jp의 Frobenius 노름을 최소화한다. - 데이터 샘플링: Phase 1에서는 소스 프레임 수 K를 1~4 사이 균등 분포로 샘플하고 Phase 2에서는 16-camera NeRSemble에서 cross-camera 및 cross-time 샘플링을 혼합한다. - 최적화: Phase 1은 Adam, Phase 2는 AdamW를 사용하며, Phase 2의 cross-time mix 및 L2-SP anchor를 통해 도메인 간 이전을 달성한다.
관련 Figure

방법론 블록의 흐름과 두 모드 간 연결 고리를 시각적으로 확인 가능하다. 모듈 간 데이터 흐름과 UV-매시 바운드 구조를 이해하는 데 도움을 준다.
SpatialAvatar-0의 피처 흐름 및 두 단계 재구성 흐름을 요약한 도식
주요 결과
주요 벤치마크 및 Ablation은 논문 표에 따라 제시된다. - VFHQ에서 Feed-forward(FF) zero-shot reenactment에서 Ours-FF는 PSNR 23.34, SSIM 0.875, LPIPS 0.077로 GAGAvatar보다 각각 +1.5 dB, +0.057, +0.794 차이를 보이며 우수하다. Cross-reenactment에서도 비슷한 우수성을 보인다. - HDTF에서도 Ours-FF가 PSNR 24.67, SSIM 0.916, LPIPS 0.076으로 GAGAvatar 대비 +1.54 dB PSNR 향상이다. - Per-subject 벤치마크인 SplattingAvatar에서 Ours+S3는 MSE 0.402×10^-3, PSNR 33.96, SSIM 0.971, LPIPS 0.355로 기존 리더보다 우수하며, GeoAvatar 대비 PSNR +1.3 dB를 달성하고 학습 반복 수를 30×60× 감소시켰다. - 학습 속도와 효율성: per-subject 재구성은 RTX 3090에서 약 2.0분 수준으로 완료되며, 추론은 512×512에서 초당 265.6프레임으로 실시간에 가깝다. FF 파트의 프레임 생성은 약 50ms 수준이다. - Ablation: Phase 1 학습 스케줄은 LinearLR이 Default보다 PSNR이 약 0.10.5 dB 높고, Phase 2의 학습률 감소 γLR과 Jacobi 페널티 λ jac의 값이 성능에 중요한 영향을 준다. L2-SP 앵커와 cross-time mix의 조합이 Cross-domain 보호를 강화한다.anti-spike 구성요소 중 모든 구성요소를 활용하면 최적 성능이 달성되며, 하나라도 제거하면 성능 저하가 발생한다.
관련 Figure

Cross-domain 성능 향상을 직관적으로 보여주는 그림으로, 도메인 간 일반화의 효과를 확인하는 데 기여한다.
Cross-domain zero-shot 평가의 정량적 비교 표의 시각적 예시

per-subject refinement의 결과를 다양한 인물에서 확인하는 샘플로, 고주파 디테일 유지와 얼굴 형상의 일관성을 시각적으로 확인 가능하다.
Per-subject 남성/여성 인물의 다수 샘플 몽타주

크로스 아이덴티티 설정에서의 재현 품질과 아이덴티티 보존 여부를 직관적으로 보여준다.
Cross-identity 피처 교차 샘플의 비교 샷
기술 상세
전체 아키텍처는 Stage 1의 feed-forward 생성기와 Stage 2의 per-subject refinement로 나뉜다. Stage 1은 DINOv3 ViT-B/16 백본으로 Dense feature map과 CLS 토큰을 생성하고, UV 공간으로 바리센틱 워프하며, 32채널의 UV 출력을 five heads로 디코드한다. K=1인 경우에는 source UV 특징과 CLS 토큰의 평균풀링을 사용하고, K>1일 때는 파라미터 없는 mean-pooling으로 다중 소스를 합친다. FLAME binding은 Qian et al.의 tracker로 회수하고, UV 픽셀-대-가우시안 맵으로 계층화한다. Stage 2는 per-subject refinement로, Gaussians의 바인딩과 Gaussian 수를 고정하고, 매 프레임마다 FLAME 메쉬를 변형시키고 Eq. (1)을 통해 Gaussian을 world 좌표로 변환한 후 differentiable 3DGS로 렌더링한다. Anti-spike 정규화는 scale-free warmup(0-500 iterations), hard log-scale clamp(500+), 화면 공간 anti-anisotropy penalty를 포함한다. 손실은 photometric(L1, MS-SSIM, LPIPS)와 UV-domain TV(포지션, 스케일), boundary, Jacobian penalty 등을 복합적으로 가중하여 최적화한다. Jacobian 페널티는 per-pixel view-direction invariance를 위해 Hutchinson 샘플링으로 근사하고, log(1+‖J‖F^2)로 래핑하여 초기 학습의 불안정성을 제어한다. 데이터 샘플링은 Phase 1에서 K를 균등 분포로 샘플하고, Phase 2에서 cross-camera 다중 뷰와 cross-time 샘플링을 혼합한다. 실험은 CelebV-HQ 및 NeRSemble로 학습하고 VFHQ/HDTF, SplattingAvatar로 제로샷 평가를 수행한다.
실무 활용
실무에서 고해상도 4D head avatar를 단일 이미지 또는 소수의 소스 뷰로 생성하고, 실시간 애니메이션 및 원격 프레젠스에 적용 가능하다. 피처 재현성은 cross-domain zero-shot에서도 유지되며, per-subject 재구성은 짧은 시간 내에 제공된다.
- 실시간 AR/VR Telepresence
- 디지털 휴먼 인터랙티브 콘텐츠 제작
- 단일 이미지에서의 4D 여타 애니메이션 제작
- 크로스-도메인 디지털 휴먼의 제로샷 적용
코드 공개 여부: 비공개
키워드
용어 해설
- FLAME-mesh-bound Gaussian
- — FLAME 메시 바운드 상에 매핑된 Gaussian 표현으로, UV 그리드의 각 픽셀마다 하나의 Gaussian을 배치하고 삼각형 바인딩과의 고정 관계를 유지하는 구성이다. 이 표현은 서로 다른 소스 뷰를 하나의 네트워크에서 처리할 수 있도록 하며, 다소 복잡한 머리 형상을 안정적으로 렌더링하는 inductive bias를 제공한다.
- Gaussian Splatting
- — 3D Gaussian Splatting(3DGS)은 구체를 Gaussian으로 표현하고 그래픽 파이프라인에서 빨리 렌더링하는 기법이다. 본 논문은 이를 머리 아바타 재구성에 적용하여 실시간 렌더링과 고주파 디테일을 달성한다.
- identity-prior collapse
- — 다수 소스 뷰를 동시에 학습하는 과정에서, 다중 뷰 세트가 서로 다른 아이덴티티 프라이어를 지시하게 되어, 본래의 아이덴티티 정보를 잃어버리거나 작은 뷰 세트에 과적합하는 현상이다.
- anti-spike regularization
- — Gaussian 분포의 비 비례적 확장을 억제하기 위한 규칙으로, densification 제거 시 발생하는 축 방향 늘어남(spike)을 억제하는 세 가지 구성요소(스케일 프리 워밍업, 로그 스케일 클램프, 화면 공간 비비대칭 억제)를 포함한다.
- densification
- — Gaussian의 밀도를 증가시키는 과정을 말하며, 3DGS에서 자세한 재구성에 유용하지만 upstream 레벨의 인덱티브 바이어스 제거를 방해한다. SpatialAvatar-0은 이를 제거하고 레이아웃을 보존한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.