TL;DR
Novel View Synthesis는 입력 이미지에 없는 물체 시점을 생성하지만, 기존 방식은 입력 상대 좌표나 제한된 전역 시점 때문에 목표 방향을 직접 제어하기 어려웠습니다. 이 연구는 Normalized Object Coordinate Space에서 목표 시점의 절대 카메라 자세만 사용하고, 이를 전용 camera tokens로 이미지 편집 모델에 전달합니다. 물체의 canonical coordinate frame을 정의하는 텍스트와 방향이 정렬된 데이터셋을 함께 사용해 NOCS의 좌표 모호성과 미관측 범주 일반화 문제를 보완했습니다. 실험에서는 다양한 범주의 촬영 정보 없는 이미지에서 방향이 일관된 새 시점을 생성했으며, 이미지 품질과 원본 충실도에서 state-of-the-art 결과를 기록했습니다.
빠른 이해
새로운 점
입력 이미지의 상대적 카메라 자세 대신 NOCS의 절대 목표 자세를 사용하고, 이미지 편집 모델과 NOCS 텍스트 정의를 결합해 전역 시점을 제어합니다.
핵심 메커니즘
촬영 자세가 없는 단일 또는 소수의 입력 이미지와 목표 시점의 NOCS 절대 카메라 자세를 입력으로 받아 camera tokens와 물체의 canonical coordinate frame을 설명하는 텍스트를 멀티모달 조건으로 결합합니다. 이를 이미지 편집 모델에 전달해 입력 물체의 외형과 기준 방향을 유지한 새 시점 이미지를 출력합니다.
섹션별 상세
전역 시점 제어의 한계
NOCS 기반 카메라 조건화
이미지 편집 모델과 데이터 구성
용어 해설
- 새 시점 합성(Novel View Synthesis)
- — 한 장 또는 여러 장의 입력 이미지에서 관측하지 않은 물체·장면의 시점을 생성하는 기술입니다. 카메라 위치와 방향을 바꾼 결과 이미지를 만들어 3D 탐색과 시각화에 활용할 수 있습니다.
- 정규화 객체 좌표 공간(Normalized Object Coordinate Space)
- — 물체마다 제각각인 실제 좌표 대신, 물체의 기준 방향과 위치를 정규화해 공통 좌표계로 표현하는 방식입니다. 이 좌표계의 절대 카메라 자세를 사용하면 입력 이미지의 촬영 조건과 무관하게 목표 시점을 지정할 수 있습니다.
- 카메라 토큰(Camera Tokens)
- — 카메라 위치와 방향 정보를 모델 입력에 전달하는 전용 토큰입니다. 이 연구에서는 이미지와 텍스트를 함께 조건으로 사용하는 in-context multi-modal conditioning 과정에 카메라 정보를 삽입해 목표 시점에 맞는 이미지를 생성합니다.
- 인컨텍스트 멀티모달 조건화(In-context Multi-modal Conditioning)
- — 이미지·텍스트·구조화된 카메라 정보를 하나의 맥락으로 묶어 생성 모델의 출력 조건으로 사용하는 방식입니다. 서로 다른 정보원을 동시에 제공해 시점, 물체의 기준 좌표, 시각적 외형을 함께 제어합니다.
기술
- Novel View Synthesis (NVS)
- Normalized Object Coordinate Space (NOCS)
- Diffusion modeling
- Generative AI
- Multimodal interaction
- 3D modeling / imaging
- Synthetic data generation
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.