왜 중요한가
4D 메쉬 생성은 시간 축의 변형, topology 변화, 투명 재질 및 내부 표면 재구성에 도전이 있다. Helix4D는 Trellis2의 프리트레인 품질을 보존하면서 비디오 조건의 4D 생성을 가능하게 하여 복합 재질과 얇은 구조, 내부 표면 재구성 등 어려운 사례를 고품질로 다룬다.
핵심 기여
4D generation with non-manifold geometry and translucent materials
Trellis2를 확장해 4D에서 non-manifold geometry, topology changes, transparent/sem-transparent materials를 고품질로 표현하는 프레임-조건화 피드포워드 생성기를 제공한다.
Cross-frame attention with first-frame anchor
슬라이딩 윈도우 크로스-프레임 어텐션과 first-frame anchor를 도입해 프레임 간 정보를 효율적으로 공유하고 데이터 부족 문제를 완화한다.
4D rotary embedding via ReRoPE
저주파 공간 RoPE 밴드를 시간 인코딩으로 재활용하는 파라미터 프리 확장을 제시해 4D에서 공간-시간 상대 위치 정보를 보존한다.
Efficient training and strong performance on 4D benchmarks
ActionBench와 TexVerse에서 CD-3D/CD-4D 측정에서 최적 성능을 보이며, ActionBench에서 CD-3D 0.051, CD-4D 0.093, TexVerse에서 CD-3D 0.045, CD-4D 0.097를 기록한다.
First feed-forward 4D generator with advanced materials
스파스 구조/지오메트리/재료의 흐름-매칭을 통해 4D 생성 파이프라인을 구성하고, 기존 영상-대-4D 방법 대비 시간-공간 일관성을 확보한다.
핵심 아이디어 이해하기
- 4D(mesh) 생성을 위해 기존 Trellis2의 프리트레인 3D 지식을 유지하되, 프레임 간 정보를 교환하는 cross-frame attention과 시간 정보를 도입한다. 2) 4D RoPE는 공간 RoPE의 저주파 밴드를 시간 인코딩으로 재활용해 파라미터를 늘리지 않고 시간 정보를 주입한다. 3) 첫 프레임 conditioning으로 학습 데이터의 부족 문제를 해결하고, 16프레임으로 훈련해 4D 일관성을 확보한다. 4) 실험적으로 ActionBench/TexVerse에서 CD-3D/CD-4D 및 3D-이미지 정합성에서 우수한 성능을 보인다.
방법론
{"paragraphs": ["전체 접근 방식은 Trellis2를 4D로 확장하여 비디오 조건에서 동적 메시를 생성하는 것이다. 3단계의 flow-matching( sparse-structure, geometry, material) 모듈을 사용하며, O-Voxel 표현을 유지한다. 각 프레임의 토큰을 하나의 비디오 시퀀스로 취급하고, 16프레임을 한 번에 처리한다.", "Cross-frame attention은 sliding window 방식으로 프레임 간 정보를 허용하되 first-frame anchor를 이용해 전역 정보를 제공한다. 첫 프레임은 Anchor로써 Trellis2에서 생성된 상태를 사용하고, f≥1 프레임에 대해서만 flow-matching 손실을 계산한다.", "4D rotary embedding은 공간 RoPE의 저주파 밴드를 시간 축에 할당하는 방식으로, α=0.75를 사용해 공간에서 고주파를 유지하고 저주파를 시간으로 재분배한다. RoPE의 공간-시간 구분은 블록 대각 구조를 유지한다.", "학습 세부사항으로 TexVerse-1K에서 55k 객체를 수집하고 각 애니메이션을 16프레임으로 구성한다. 해상도는 1024×1024이며 32 GPU(A100)로 20k 이터레이션에 걸쳐 AdamW로 학습한다."], "figures": [] }
주요 결과
주요 벤치마크에서 Ours는 Baseline 대비 전 영역에서 향상된 품질과 시간적 일관성을 보였다. 예를 들어 ActionBench의 CD-3D는 0.051, CD-4D는 0.093으로 최저치를 기록했고 TexVerse의 CD-3D는 0.045, CD-4D는 0.097로도 최저치를 보였다. Helix4DBench에서 CLIP, CLIP-N, ULIP-2, Uni3D 등 모든 지표에서 우수한 성능을 달성했고, 사용자 설문에서도 다수의 선호를 얻었다. Ablation 연구에서 첫 프레임 conditioning의 제거가 성능 저하에 가장 큰 영향을 주었고, 4D rotary를 제거하면 기하가 왜곡되었다. 다른 패턴들보다 전체적으로 sliding window + anchor 방식이 최적의 품질과 속도 균형을 보였다.
관련 Figure

4D 생성의 질감을 비교하는 핵심 시각 자료이며 얇은 구조와 투명 물체의 재현 차이를 강조한다.
Ours와 ActionMesh, Motion 3-to-4, Mesh4D 간의 프레임 시퀀스 비교를 보여주는 다중 패널 그림.

다양한 시나리오에서 Ours의 우수성을 시각적으로 확인하게 해주며 4D 로직의 효과를 뒷받침한다.
TexVerse/ActionBench에서의 비교 결과를 나타낸 표/그림 모음.
기술 상세
"전체 아키텍처: Trellis2를 4D로 확장하는 파이프라인, 3단계(flow-matching) 구조, O-Voxel 기반의 희소 구조로 구성한다. 수학적 기반: cross-frame attention에서 M(mask)으로 프레임 간 연결을 제어하고, 4D RoPE는 공간 RoPE의 저주파를 시간 축으로 재배치한다. Prior work 대비 차별점: 비집합적 topology 변화와 내부 표면 재구성을 가능하게 하는 O-Voxel 표현을 유지하면서 4D 확장을 수행한다. 학습 구현: TexVerse-1K 데이터에서 16프레임으로 학습하며, 32 GPU에서 20k 이터레이션, AdamW를 사용한다."
관련 Figure

4D rotary의 필요성과 역할을 시각적으로 보여주는 그림으로, 저주파를 시간에 재할당하는 효과를 시사한다.
4D rotary와 anchor 없이의 차이를 보여주는 비교 그림.
한계점
Trellis2 백본의 한계로 인해 메쉬에 구멍이 생길 수 있으며, 텍스처의 색상 편차 현상이 존재한다. 또한 시퀀스의 고주파 기하 디테일이 큰 경우 시간적 일관성은 여전히 어려움이 있다.
실무 활용
비디오로부터 동적 4D 메시를 자동으로 생성하는 실용적인 파이프라인을 제공한다.
- 애니메이션/게임에서 동적 4D 자산 자동 생성
- VR/AR 콘텐츠의 4D 씬 제작 및 변형 재현
- 영화 VFX의 비디오-기반 4D 재구성 및 시퀀스 보정
코드 공개 여부: 미확인
키워드
용어 해설
- O-Voxel
- — O-Voxel은 표면 근처의 활성화된 보셀만 남겨 두는 희소 근접 표면 표현이다. 얇은 구조나 비watertight 표면, 내부 표면, 투명 재질의 세밀한 지오메트리 재구성이 가능하고 메모리 효율이 높다.
- Sparse Compression VAE
- — Sparse Compression VAE는 희소 보셀 특징을 효율적으로 압축하는 Variational Autoencoder로, 고해상도 3D Asset의 구조-지오메트리-재료 정보를 잠재 공간에 축소해 빠른 샘플링과 학습을 가능하게 한다.
- Flow-Matching(flow-matching)
- — Flow-matching은 세 흐름의 매칭으로 구조·지오메트리·재료 잠재를 연계해, 입력으로부터 확장된 흐름 모형으로 프레임 간 일관된 합성을 수행한다.
- RoPE
- — RoPE(Rotary Position Embedding)는 쿼리와 키에 회전을 적용해 위치 정보를 유도하는 인코딩 기법이다. 공간 축 x,y,z에 대해 다차원적으로 상대 위치를 반영한다.
- ReRoPE
- — ReRoPE는 RoPE의 저주파 공간 밴드를 시간 인코딩으로 재활용하는 방법으로 파라미터를 늘리지 않고 4D에서 위치 정보를 보존한다.
- TexVerse
- — TexVerse는 3D 객체와 고해상 텍스처를 포함하는 대규모 데이터셋으로, 4D 생성 연구의 평가에 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.