본문으로 건너뛰기
HF Daily Papers조회 2

WorldSculpt: 접지 영상에서 조합형 3D 월드 생성

다중 시점 특징을 객체별 표준 좌표계에 정렬해 가려진 장면을 독립 mesh들의 3D 월드로 복원합니다.

용어 해설

조합형 3D 표현(Compositional 3D Representation)
복잡한 장면을 하나의 통합된 표면으로 저장하지 않고, 각 객체를 독립적인 3D mesh와 위치 정보의 묶음으로 표현하는 방식입니다. 객체별 선택·이동·재배치가 가능해 게임, AR/VR, 시뮬레이션 같은 후속 처리에 적합합니다.
3D 생성 사전학습 모델(3D Generative Prior)
대규모 3D 객체 데이터에서 학습한 형상 분포를 바탕으로 관측되지 않은 부분의 구조를 추정하는 생성 모델입니다. WorldSculpt에서는 부분적으로 가려진 관측을 입력받아 완전한 객체 mesh를 복원하는 데 쓰입니다.
다중 시점 조건화(Multi-view Conditioning)
한 객체를 여러 카메라 시점에서 관측한 정보를 생성 모델의 조건으로 함께 넣는 방식입니다. 각 시점의 2D 특징을 공통 3D 좌표에 정렬한 뒤 결합해, 단일 이미지에서 발생하는 가림과 형상 누락을 줄입니다.
앵커 정렬 표준 좌표계(Anchor-aligned Canonical Frame)
객체가 가장 잘 관측된 기준 시점을 앞면으로 삼아 객체별 가상 정육면체 좌표계를 구성하는 절차입니다. 여러 영상의 관측을 동일한 좌표에 맞춘 뒤 생성된 mesh를 다시 원래 월드 좌표로 변환할 수 있게 합니다.
Flow Matching
잡음 상태에서 목표 3D 잠재 표현으로 이동하는 연속적인 변환 경로를 학습하는 생성 방식입니다. Pixal3D는 먼저 점유 구조를 예측하고 이어서 고해상도 형상 잠재 표현을 생성해 최종 mesh로 복호화합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.