본문으로 건너뛰기

비디오 latent에서 직접 4D 세계 생성

공유 VAE latent를 RGB 없이 4D decoder에 연결해 여러 video DiT에서 geometry와 motion을 복원합니다.

왜 중요한가

기존 generate-then-reconstruct 방식은 생성 latent를 RGB로 복원한 뒤 별도 4D 모델에 넣으므로 RGB artifact와 분포 차이가 geometry로 전파될 수 있습니다. Latent-to-4D는 이 경계를 건너뛰고 여러 compatible DiT가 공유하는 VAE latent를 직접 4D decoder로 연결해, 하나의 geometry-supervised checkpoint를 다른 생성기와 조건 방식에 재사용합니다.

핵심 기여

공통 VAE latent를 4D 인터페이스로 활용

최종 denoised VAE latent를 video generator와 explicit 4D prediction 사이의 재사용 가능한 인터페이스로 정의합니다. 생성된 RGB를 거치지 않아 RGB decoding과 재인코딩에서 발생하는 오류 경로를 제거합니다. 같은 VAE 규칙을 공유하는 DiT 사이에서 4D supervision과 생성기를 분리합니다.

L4AR 기반 직접 latent-to-4D 경로

L4AR은 video latent를 pretrained 4D decoder가 요구하는 token grid로 변환합니다. 3D convolution으로 국소 시공간 정보를 모은 뒤 frame-wise와 global attention을 교차 적용해 구조와 motion context를 보강합니다. 정제된 표현은 camera와 dynamic world-space geometry 예측으로 이어집니다.

여러 video DiT에서 단일 checkpoint 검증

약 1K개의 reconstruction clips로 학습한 하나의 checkpoint를 두 text-to-video DiT와 한 image-to-video DiT에 추가 tuning 없이 적용합니다. Text4D-200과 I4D-200에서 matched Wan+4RC cascade보다 projection-based DINO-F1이 각각 2.88–3.45점과 5.81점 높습니다. 사람 평가에서도 geometry, completeness, temporal stability, overall quality 선호도가 baselines보다 높게 나타납니다.

핵심 아이디어 이해하기

일반적인 video generator는 조건과 noise에서 denoising을 거쳐 video latent를 만들고, VAE decoder가 이를 RGB frame으로 바꿉니다. 기존 4D 생성 pipeline은 이 RGB를 다시 별도 reconstruction encoder에 넣어 camera와 geometry를 추정하므로, 생성 frame의 구멍이나 temporal artifact가 4D 구조에 전달될 수 있습니다. 특히 reconstruction model은 상대적으로 좁은 데이터로 학습되어 생성 영상의 분포를 충분히 다루기 어렵습니다.

Latent-to-4D는 RGB를 중간 결과로 만들지 않고 VAE latent에서 바로 4D token으로 이동합니다. 먼저 latent의 temporal resolution과 spatial grid를 고정된 trilinear resampling으로 맞추고, 학습 가능한 3D convolution이 이웃한 appearance와 motion 신호를 모아 4D decoder가 기대하는 feature dimension으로 투영합니다. 이 과정의 출력은 프레임 수, 프레임당 spatial token 수, token dimension을 갖는 구조화된 token grid입니다.

3D convolution만 사용하면 먼 시점의 대응이나 camera motion을 충분히 연결하기 어렵습니다. 그래서 L4AR은 각 프레임 내부의 spatial structure를 frame-wise attention으로 통합한 뒤 global attention으로 모든 spatial location과 time step 사이의 정보를 교환하고, 두 attention 범위를 교차해 세부 구조와 장거리 motion context를 함께 유지합니다. 그 결과를 pretrained 4D hierarchy에 넣어 시점별 camera와 world-space dynamic point map을 얻습니다.

학습 때는 frozen VAE가 annotated reconstruction video를 latent로 바꾸고, alignment module과 LoRA 기반 refinement update, camera·geometry head만 4D annotation으로 최적화합니다. 추론 때는 같은 형식의 observed-video latent 대신 compatible DiT의 final denoised latent를 넣으며 downstream 경로는 그대로 둡니다. 따라서 DiT의 조건이 이미 latent 안에 반영된 상태에서 별도의 조건별 4D branch 없이 text, image, motion, pose, trajectory 조건을 유지할 수 있습니다.

관련 Figure

기존 generate-then-reconstruct 경로와 Latent-to-4D 경로가 video latent를 처리하는 방식의 차이를 비교한 구조도입니다.
Diagram

위쪽 경로는 noise에서 DiT가 latent를 만든 뒤 VAE Decoder로 RGB를 복원하고, 4D Reconstruction Model이 그 RGB에서 geometry를 추정합니다. 아래쪽 Ours 경로는 DiT의 latent를 L4AR로 4D latent에 직접 변환한 뒤 4D Decoder로 point map을 만들므로 RGB 중간 표현을 건너뜁니다. 이 도식은 논문의 핵심인 latent 공간의 직접 연결과 RGB artifact 전파 경로 제거를 나타냅니다.

기존 generate-then-reconstruct 경로와 Latent-to-4D 경로가 video latent를 처리하는 방식의 차이를 비교한 구조도입니다.

방법론

Latent-to-4D는 video VAE latent에서 pretrained 4D reconstructor의 structured token space로 직접 매핑하는 구조입니다. 학습 입력은 frozen VAE가 영상에서 추출한 posterior-mean latent이고, 추론 입력은 compatible DiT가 조건과 noise를 처리한 뒤 출력하는 final denoised latent입니다. 두 입력은 같은 VAE checkpoint, latent normalization, tensor layout, compression convention, 지원 shape를 공유해야 하며 RGB decoding은 geometry 입력으로 사용하지 않습니다.

Alignment Module은 먼저 VAE latent의 시공간 해상도를 필요한 token grid에 맞춥니다. 이후 학습 가능한 3D convolution이 인접한 시간·공간 영역을 집계하고 latent channel을 4D hierarchy의 feature dimension으로 바꾼 뒤 spatial dimension을 flatten합니다. 이렇게 생성된 token은 프레임별 spatial token과 token feature로 구성되어 다음 refinement 단계의 입력이 됩니다.

Spatiotemporal Refinement Module은 pretrained 4D hierarchy의 frozen weight를 재사용하면서 rank-16 LoRA update를 학습합니다. Frame-wise attention은 입력을 batch와 frame을 합친 형태로 재배열해 각 프레임의 spatial token 사이 관계를 계산하고, global attention은 모든 프레임과 spatial location을 하나의 시퀀스로 묶어 시간과 viewpoint 사이의 대응을 계산합니다. 여러 깊이에서 얻은 두 attention 출력을 결합해 4D decoder에 intra-frame geometry와 cross-frame motion 단서를 함께 전달합니다.

4D Decoder는 각 프레임과 pixel 위치에서 depth, world-space ray origin, unit ray direction 및 confidence를 예측하고 별도의 camera head에서 9D pose–field-of-view parameterization을 산출합니다. World-space point는 ray origin에 depth를 곱한 ray direction을 더해 계산되므로 depth가 변하면 같은 camera ray 위의 3D 위치가 이동합니다. Camera와 dynamic point map을 함께 사용하면 입력 frame에만 머물지 않고 다른 viewpoint와 time으로 장면을 재투영할 수 있습니다.

전체 loss는 uncertainty-aware depth·depth-gradient·world-ray 항, camera translation·rotation·field-of-view 항, metric depth·ray·world-space point·surface-normal 항으로 구성됩니다. 학습 대상은 Alignment Module, lightweight refinement update, geometry head, camera head이며 video generator, VAE, original Transformer weight, camera·time token, motion decoder, tracking head는 고정합니다. 안정적인 pretrained geometric prior를 보존하기 위해 trainable component를 단계적으로 활성화합니다.

관련 Figure

영상 latent를 4D latent로 정렬하고 정제한 뒤 dynamic 4D point map을 생성하는 L4AR 내부 구조도입니다.
Diagram

Video는 VAE Encoder를 거쳐 latent가 되고, L4AR은 Grid Align과 3D Conv로 token grid와 feature dimension을 맞춥니다. Camera와 Time token을 결합한 뒤 Frame Attention과 Global Attention을 차례로 적용해 프레임 내부 구조와 전체 시공간 대응을 정제합니다. 마지막 4D Decoder가 정제된 4D latent에서 dynamic world-space point map을 복원합니다.

영상 latent를 4D latent로 정렬하고 정제한 뒤 dynamic 4D point map을 생성하는 L4AR 내부 구조도입니다.

주요 결과

Text4D-200에서 Latent-to-4D는 Wan2.1-14B 입력 기준 Text CLIP 28.544, RGB-reference CLIP-I 72.24, DINO global 45.43, DINO match 57.52, DINO F1 57.01을 기록했습니다. Wan2.1-1.3B 입력에서도 DINO F1 57.09를 기록해 두 text DiT에서 거의 같은 성능을 유지했습니다. Matched Wan+4RC 대비 DINO-F1 개선 폭은 2.88–3.45점이지만, RGB-reference CLIP-I에서는 CogVideoX-5B+4RC가 가장 높아 모든 지표에서 일관된 우위를 주장하지 않습니다.

I4D-200에서는 Text CLIP 27.340, RGB-reference CLIP-I 72.87, DINO global 54.85, DINO match 61.85, DINO F1 61.60으로 모든 보고 지표에서 가장 높은 값을 기록했습니다. Matched Wan2.2-I2V-A14B+4RC의 DINO F1 55.79보다 5.81점 높습니다. Off-axis DINO 지표는 보이는 geometry의 coherence와 completeness를 평가하는 appearance-dependent proxy이므로 metric 4D accuracy 자체를 의미하지 않습니다.

사람 평가에는 benchmark별 50개 sampled case와 50명의 참가자가 참여했고, 각 case는 10회의 randomized anonymized pairwise rating을 받았습니다. Text-to-4D에서 Ours의 선호도는 condition fidelity 59.2%, geometry and completeness 66.8%, temporal stability 63.5%, overall quality 65.7%였고, Image-to-4D에서는 각각 66.4%, 72.1%, 68.3%, 70.6%였습니다. 참가자는 motion replay와 multiple viewpoint inspection을 사용했으며, 모든 구간이 50%를 넘었지만 이 결과도 metric geometry를 직접 측정하지는 않습니다.

Component ablation에서 Full 모델은 7-Scenes의 Acc 3.121cm, Comp 5.418cm, NC 0.628과 NRGBD의 Acc 5.202cm, Comp 8.187cm, NC 0.766을 기록했습니다. Grid Align, 3D Conv, Frame attention, Global attention을 각각 제거하면 두 ground-truth benchmark에서 정확도와 completeness가 모두 악화됩니다. 특히 3D convolution이나 두 attention 범위 중 하나를 제거했을 때 하락 폭이 커져 local alignment와 시공간 refinement가 함께 필요함을 뒷받침합니다.

관련 Figure

Text 조건에서 4RC, π³, Any4D, Ours가 생성한 4D point map을 비교한 정성 결과입니다.
Diagram

각 행은 자동차, 불과 물, 흔들리는 옷, 식물 잎처럼 관절 운동·상호작용·얇은 구조·미세 motion이 포함된 장면을 나타냅니다. Ours 열은 비교 방법보다 주요 대상과 주변 장면 구조를 더 많이 유지하는 결과로 배치되어 있고, 다른 결과에는 holes, fragmented surface, missing structure가 나타납니다. 이 비교는 한 off-axis frame에서 geometry plausibility, completeness, content preservation을 평가하며 temporal stability 자체를 직접 측정하지는 않습니다.

Text 조건에서 4RC, π³, Any4D, Ours가 생성한 4D point map을 비교한 정성 결과입니다.

Image-to-4D 조건에서 실내외 장면과 사람의 결과를 여러 방법으로 비교한 정성 결과입니다.
Diagram

실내 폭포, 화분을 든 노인, 산의 사찰, 고개를 돌리는 여성에 대해 4RC, π³, Any4D, Ours의 point map을 나란히 비교합니다. Ours는 generate-then-reconstruct 결과보다 foreground와 source structure를 더 많이 보존하는 형태로 나타납니다. 표의 I4D-200 지표에서 Ours가 모든 평가 항목에서 가장 높은 값과 함께 배치된 정성 근거입니다.

Image-to-4D 조건에서 실내외 장면과 사람의 결과를 여러 방법으로 비교한 정성 결과입니다.

7-Scenes와 NRGBD에서 point-map, camera translation, camera rotation 오차를 반경별로 비교한 그래프입니다.
Chart

세 행은 각각 point-map RMSE, camera translation RMSE, mean camera rotation을 나타내고 두 열은 7-Scenes와 NRGBD입니다. 파란 Ours 곡선은 반경이 증가해도 거의 0에 가까운 값에 머무는 반면, 주황색 Decode-RGB + 4RC 곡선은 반경 0.6에서 point-map 약 0.38과 0.31, translation 약 0.12와 0.11, rotation 약 1.60과 0.80까지 증가합니다. RGB를 거치지 않는 latent 경로가 camera와 geometry drift에 덜 민감하다는 진단 실험의 수치적 근거입니다.

7-Scenes와 NRGBD에서 point-map, camera translation, camera rotation 오차를 반경별로 비교한 그래프입니다.

기술 상세

입력 표현은 video VAE latent이며, observed video에서는 frozen VAE encoder의 posterior mean을 사용하고 generated sample에서는 compatible DiT가 VAE decoding 직전에 만든 final denoised latent를 사용합니다. Alignment Module은 고정 trilinear resampling과 학습 가능한 3D convolution을 순서대로 적용해 temporal resolution, spatial grid, feature dimension 차이를 보정합니다. 이후 token grid를 flatten해 4D hierarchy가 처리할 수 있는 시공간 token으로 변환합니다.

Refinement hierarchy는 31개 block으로 초기화되고 4RC의 pretrained weight를 사용합니다. Frame-wise attention은 각 frame 내부의 M개 spatial token 관계를 계산하고, global attention은 T개 frame 전체의 T×M token 관계를 계산합니다. 두 attention을 번갈아 적용하면서 중간 깊이의 frame-wise와 global feature를 연결해 공간 detail, correspondence, viewpoint 변화, motion 정보를 동시에 유지합니다.

4D Decoder의 geometry head는 depth와 world-space ray의 origin·direction·confidence를 예측하고, camera head는 9D pose–field-of-view parameterization으로 시점별 camera를 추정합니다. 각 pixel의 3D point는 예측 ray origin에서 시작해 예측 depth만큼 unit ray direction을 이동한 위치입니다. 따라서 depth와 ray가 결합되어 시간에 따라 변하는 dense point map이 되고, camera와 함께 novel viewpoint rendering에 사용됩니다.

학습 loss는 uncertainty-aware depth·depth-gradient·world-ray supervision, camera translation·rotation·field-of-view supervision, metric depth·ray·world-space point·surface-normal supervision을 합산합니다. 최종 학습 단계는 여섯 reconstruction dataset에서 1,143 clips를 사용했으며, 전체 학습은 대략 1K clips 규모입니다. Test benchmark는 held out이고 test-time adaptation은 사용하지 않습니다.

공통 VAE 조건 아래에서 Wan2.1-T2V-14B, Wan2.1-T2V-1.3B, Wan2.2-I2V-A14B에 하나의 checkpoint를 적용했습니다. DiT architecture와 conditioning regime은 달라도 VAE checkpoint와 latent 규약이 같으면 같은 downstream pathway를 사용할 수 있습니다. DiT-derived residual을 통제해 추가한 실험에서 ρ=0.6일 때 point-map drift는 Ours가 7-Scenes와 NRGBD에서 0.0053/0.0047, baseline이 0.3827/0.3160으로 측정됐습니다.

한계점

평가는 동일한 VAE convention을 공유하는 세 compatible DiT와 Text4D-200·I4D-200 범위에 한정됩니다. Off-axis DINO 점수와 사람 평가는 보이는 geometry의 coherence, completeness, temporal stability를 보완적으로 측정하지만 생성 장면의 metric geometry accuracy를 확립하지는 않습니다. 또한 upstream control 사례는 interface compatibility를 확인하는 용도이며 action success나 physical correctness를 측정하지 않습니다.

실무 활용

Latent-to-4D는 동일한 VAE convention을 사용하는 text-to-video와 image-to-video generator의 최종 latent를 dynamic 4D scene으로 변환하는 후단 경로로 활용할 수 있습니다. 학습된 L4AR checkpoint와 4D decoder를 유지한 채 upstream generator의 조건 제어를 이어받으므로, 생성기별로 geometry-supervised branch를 다시 학습하지 않는 구성이 가능합니다.

  • Text 조건으로 생성한 영상 latent에서 여러 viewpoint와 time으로 재투영 가능한 dynamic point map을 생성하는 작업
  • Image-to-video latent에서 사람, 동물, 실내·실외 장면의 camera와 dynamic geometry를 추정하는 작업
  • motion, appearance, pose, trajectory, manipulation, navigation control이 반영된 latent를 4D 표현으로 변환하는 작업
  • 생성 RGB의 복원 품질에 의존하지 않고 video prior와 pretrained 4D reconstruction hierarchy를 결합하는 연구

코드 공개 여부: 비공개

관련 Figure

Text, image, pose, route 조건에서 생성된 4D 결과를 비교한 추가 제어 사례입니다.
Diagram

스케이트보드 동작, 선글라스를 쓰는 여성, pose sequence를 따르는 robot chef, 온실을 가로지르는 clockwork fox가 여러 시점의 4D 결과로 표현됩니다. 입력 조건의 동작·appearance·pose·trajectory 정보가 하나의 L4AR checkpoint를 거쳐 장면 구조와 motion으로 이어지는 형태입니다. 이 사례들은 action success나 physical correctness가 아니라 upstream control과 latent interface의 호환성을 보여주는 자료입니다.

Text, image, pose, route 조건에서 생성된 4D 결과를 비교한 추가 제어 사례입니다.

로봇 조작 장면에서 cereal scooping, 천 집기, 상자 열기, 소화전함 닫기 동작의 4D 결과를 보여주는 사례입니다.
Diagram

각 행은 robotic gripper 또는 humanoid robot이 특정 물체와 상호작용하는 입력 장면과 여러 시점의 재구성 결과를 나타냅니다. L4AR은 manipulation과 navigation 조건이 포함된 compatible backbone의 latent를 받아 로봇, 물체, 실내 배경의 동적 point structure를 유지합니다. 논문은 이를 실제 조작 성공의 증거가 아니라 manipulation·navigation control이 downstream 4D 표현으로 전달되는지 확인하는 예시로 사용합니다.

로봇 조작 장면에서 cereal scooping, 천 집기, 상자 열기, 소화전함 닫기 동작의 4D 결과를 보여주는 사례입니다.

키워드

4D generation(4D 생성)VAE(변분 오토인코더)video diffusion transformer(비디오 diffusion Transformer)latent-to-4D(잠재 표현에서 4D로 변환)spatiotemporal attention(시공간 어텐션)4D decoder(4D 디코더)

용어 해설

변분 오토인코더(VAE)
VAE는 입력 영상을 더 작은 잠재 표현으로 압축한 뒤 다시 복원하는 신경망 구조입니다. 이 논문에서는 여러 video generator가 같은 VAE checkpoint, 정규화, 텐서 배치, 압축 규칙을 공유하도록 하여 서로 다른 DiT의 최종 latent를 하나의 4D 예측 경로에 연결하는 공통 인터페이스로 활용합니다.
Diffusion Transformer(DiT)
DiT는 Transformer를 diffusion 과정의 denoising backbone으로 사용하는 생성 모델입니다. 조건과 noise를 입력받아 반복적인 denoising을 수행하고 VAE가 해석할 최종 video latent를 출력합니다. Latent-to-4D는 RGB로 복원하기 전 이 latent를 직접 받아 4D geometry를 예측합니다.
4D 재구성(4D Reconstruction)
4D Reconstruction은 시간에 따라 변하는 장면의 3D geometry와 camera trajectory를 영상에서 추정하는 작업입니다. 이 논문에서는 각 시점의 dense point map을 공통 world coordinate에 배치하고 camera, depth, ray 정보를 함께 예측합니다. 결과는 새로운 viewpoint와 시간에서 재투영할 수 있습니다.
시공간 어텐션(Spatiotemporal Attention)
시공간 어텐션은 영상의 한 프레임 안 공간 정보와 여러 프레임 사이 시간 정보를 함께 연결하는 연산입니다. L4AR은 먼저 frame-wise attention으로 각 프레임의 구조를 모은 뒤 global attention으로 모든 위치와 시점의 대응, viewpoint, motion 정보를 교환합니다. 이 조합이 동적 geometry의 세부 구조와 시간 일관성을 보완합니다.
저순위 적응(LoRA)
LoRA는 pretrained weight 자체를 바꾸는 대신 작은 저순위 업데이트 행렬을 학습하는 방식입니다. 이 논문은 31-block refinement hierarchy에 rank-16 LoRA를 적용하고 video model과 pretrained base weight는 고정합니다. 따라서 약 1K reconstruction clips의 4D supervision을 제한된 추가 파라미터로 반영합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 11.수집 2026. 08. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.