왜 중요한가
3D 자산의 물리 시뮬레이션에 필요한 Volumetric E(Young’s modulus), ν(Poisson’s ratio), ρ(density)가 대부분의 자산에서 누락되거나 불완전하다. AdaVoMP는 입력 형상에서 이들 물성 필드를 공간적으로 변화시키는 SAV( Sparse Adaptive Voxels) 구조와 Transformer 기반의 생성기를 도입해 64^3 대비 1024^3 해상도까지의 고해상도 예측을 가능하게 하며, 메모리 효율도 유지한다. 다 representation across multiple 3D formats에서의 보편적 적용 가능성을 제시한다.
핵심 기여
SAV( Sparse Adaptive Voxels) 표현
입력 형상과 물성 필드를 표현하는 다층 보셀 트리로, homogeneous 영역은 큰 보셀, 경계/이질 영역은 더 작은 보셀로 표현하여 고해상도 물성 필드를 효율적으로 생성한다.
Adaptive Geometry Transformer(AGT)
입력 SAV를 멀티뷰 DINO 특징과 unify coordinates를 이용해 인코딩하고, sparse windowed self-attention으로 컨디션 latents를 생성한다.
Adaptive Material Generator(G)
coarse-to-fine 방식으로 SAV를 autoregressively 생성. 각 후보 보셀에 대해 Empty/Keep/Subdivide 구조 예측과 2D 물성 잠재(Z)를 예측하고, Subdivide 시 다음 레벨의 후보 집합을 확장한다.
MatVAE 재사용과 학습
VoMP의 MatVAE 디코더를 Frozen 상태로 재활용해 각 비어있는 보셀에 대한 E, ν, ρ 벡터를 예측하고, Ground-truth 물성으로 손실을 계산한다.
고해상도에서의 성능 개선
Dense 64^3 대비 1024^3 해상도에서 16^3 배 해상도 향상을 달성하면서도 메모리 사용량은 관리 가능한 수준으로 유지한다.
핵심 아이디어 이해하기
출발점: 기존의 fixed-grid voxel 방식은 고해상도 물성 예측 시 계산 및 메모리 비용이 급증한다. 이를 해결하기 위해 SAV는 다계층 보셀 트리로 구성되어 중요한 지역에만 세밀도를 집중하고 나머지는 코간적으로 공유한다. 입력 형상은 multi-view DINO 특징과 방향성 정보를 결합해 AGT가 조건 벡터를 만들고, G는 이 조건을 바탕으로 SAV를 coarse-to-fine으로 만들어 물성 필드( E, ν, ρ)를 예측한다. 결과적으로 1024^3 해상도에서도 학습 가능한 파라미터 수를 유지하면서 물성 예측 정확도를 크게 높일 수 있다. 다층 구조를 통해 경계 및 경계 근처의 이질적 영역에 집중하고, 동일 영역은 큰 보셀로 표현하므로 계산 효율이 증가한다. 이 접근은 VoMP와 Pixie 같은 고정 해상도 기반 방법 대비 해상도 확장성과 정확성을 동시에 달성한다.
관련 Figure

SAV가 입력 형상과 물성 필드를 어떻게 표현하는지, 또한 Adaptive Transformer가 이를 처리하는 흐름을 직관적으로 보여준다.
AdaVoMP의 SAV 구조와 입력 형상의 멀티해상도 표현을 시각적으로 요약한 도식
방법론
- 입력 형상은 SAV로 인코딩되며, 각 보셀은 레벨 ℓ과 위치 i로 표현된다. 2) Adaptive Geometry Transformer는 각 보셀에 대해 위치 기반 RoPE를 적용한 자기 주의(attention)로 컨디션 벡터 E를 생성한다. 3) Adaptive Material Generator G는 coarse-to-fine 순서로 동작하며, 각 후보(ℓ,i)는 구조(Empty/Keep/Subdivide)와 물성 잠재 z를 예측한다. 4) 각 레벨에서 Subdivide가 선택되면 자식 보셀이 후보 집합에 추가되고, Empty인 경우 제거된다. 5) MatVAE 디코더를 통해 z를 E, ν, ρ로 매핑하여 SAV_M에 저장한다. 6) 학습은 교사 강제(teacher forcing)로 구조와 물성의 보정을 함께 수행하며, 손실은 L = λ_struct L_struct + λ_mat L_mat 로 정의된다.
관련 Figure

Adaptive Geometry Transformer의 입력 토큰 구성과 위치정보 주입 방법을 보강한다.
EMBedding 벡터와 레벨 임베딩의 구성 방식, 멀티해상도 토큰의 배치 모습

Adaptive Material Generator의 코어 구성과 코호트적 생성(coarse-to-fine)의 연결 고리를 시각화한다.
AMG Transformer Block 및 부모 상태를 통한 다층 생성 흐름

다층 생성에서의 후보군 관리 및 Subdivide/Keep 동작의 흐름을 보강한다.
AMG Generator의 희소 토큰과 계층적 생성 구조를 요약한 도식
주요 결과
주요 벤치마크에서의 성능 향상: 고정 해상도 64^3에서 Ours-H(0.6B)가 VoMP 및 다른 baselines보다 우수하며, 1024^3 해상도에서도 우수한 성능 유지. 표1에 따르면 64^3 해상도에서 ALDE, ALRE, ADE, ARE 등에서 개선이 확인되며(예: Ours-H가 가장 낮은 오차), 1024^3에서도 비슷한 흐름으로 개선이 관찰된다. 메모리 사용은 모델 규모와 해상도 증가에 따라 FPOPS가 증가하지만, memory-usage와 compute 간의 Pareto 최적화를 달성한다. SAV의 레벨-별 도해를 통해 64^3 대비 16^3 배의 효과적 해상도 향상을 달성하며(1024^3), 대규모 물성 필드의 예측이 가능하게 된다. Ground-truth SAV와의 구조 재현성은 16.16%에서 4.42% 수준의 차이로 환원되며, Ground-truth에 대한 leaf 비율은 7.24%에서 10.54%로 유지된다.
기술 상세
- 아키텍처: SAV 인코더-제너레이터 구조. 입력 Shape SAV를 Adaptive Geometry Transformer E로 인코딩하고, Adaptive Material Generator G로 물성 필드를 SAV 형태로 생성한다. MatVAE 디코더는 per-보셀의 latent z를 (E, ν, ρ)로 매핑한다. 2) 수학적 기반: SAV는 각 레벨 ℓ에서 보셀의 아이디 i를 통해 uℓ,i를 정의하고, 보셀의 leaf 여부는 Subdivide의 예측으로 결정한다. Query는 Finest-Available 방식으로 x에 대해 가장 세밀한 보셀의 벡터를 반환한다. 3) 학습 손실: L = λ_struct L_struct + λ_mat L_mat, L_struct는 구조 예측의 음의 로그 가능도, L_mat는 MatVAE를 통해 예측된 벡터와 ground-truth 벡터 간의 L2 차이를 포함한다. 4) 구현 및 데이터: 학습은 BF16 혼합 정밀도, 32×A100 GPU에서 5일 학습, Geometry with Volumetric Trees(GVT) 데이터세트 및 VLM 기반 라벨링, DINOv3 기반 다중 뷰 특징 사용. 5) 비교 및 차별점: VoMP, Pixie 등의 고정 해상도 접근법과 달리 SAV를 통해 부분적으로 상세한 지역에만 세밀화를 적용하고, Empty/Keep/Subdivide를 명시적으로 예측하는 차별점이 있다. 6) 구현 세부: spconv 기반의 희소 텐서 백엔드를 활용한 다중 레벨 토큰 관리 및 배치 학습. 7) 한계: 비선형 방향성 물질(텐서 필드) 및 다이내믹 시퀀스 영상에 대한 일반화 한계가 있으며, 물성 측정 없이 모델에 의존한 초기화의 위험이 있다.
한계점
논문에서 명시한 한계는 방향성이 강한 텐서 물성(예: 비등방성 구속)이 전개되지 않는 점, 정적 3D 자산에 초점이므로 영상 기반 동적 신호의 활용은 제한적이라는 점이다. distribution shift나 비정형 물질에 의한 예측 오차에 대한 검증 필요성이 있다.
실무 활용
실무적으로는 고해상도 물성 필드가 필요한 시뮬레이션, 로봇학습 환경, 게임 및 가상 프로덕션에서 활용 가능하다. AdaVoMP는 수작업으로 물성 매핑하는 부담을 감소시키고, 물성 필드를 자동으로 주입해 물리 시뮬레이션의 초기화 시간을 단축한다.
- Simulation-ready asset generation for deformable objects (sofa, cushions, bedframes 등)
- Physics-in-the-loop 있는 로보틱 학습 환경의 초기 물성 주입 자동화
- Gaussian splat/메시를 이용한 대규모 시뮬레이션에서 물성 필드 자동화
코드 공개 여부: 미확인
키워드
용어 해설
- 스파스 어댑티브 보셀(Sparse Adaptive Voxels (SAV))
- — 입력 형상과 물성 필드를 표현하는 다계층 잎 노드 기반의 희소 트리 구조. 동질 영역은 큰 보셀로 표현하고 이질적 영역과 경계는 더 작은 보셀로 세분화되어 해상도 효율성을 높임.
- Adaptive Geometry Transformer
- — 입력 SAV를 인코딩하기 위해 다층 Transformer로 구성된 모듈. 여러 해상도에서 정보를 융합해 컨디션 벡터를 생성하고 물성 예측에 활용.
- MatVAE
- — VoMP의 MatVAE 디코더를 고정된 파라미터로 재활용해 각 보셀의 물성(latent) 벡터를 (E, ν, ρ)로 매핑하는 디코더.
- 보셀 트리(Voxel Tree)
- — 다중 해상도 보셀을 트리 형태로 구성해 표면은 물론 부피 내부의 물성 값을 표현하는 데이터 구조.
- DINOv3 특징(DINOv3 Features)
- — 다중 뷰에서 추출한 Patch-token 특징을 입력 형상 인코딩에 활용하여 SAV의 입력 특징으로 변환하는 비지도 학습 기반 시각 특징 추출기.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.