TL;DR
Novel View Synthesis는 입력 이미지에 없는 객체 시점을 생성하지만, 기존 방식은 입력 기준 상대 자세나 제한된 전역 시점만 지원해 목표 방향을 직관적으로 제어하기 어려웠습니다. Exo2EgoPolicy는 객체의 기준 좌표계인 NOCS에서 목표 카메라의 절대 자세만 사용하고, 카메라 정보를 전용 token으로 주입해 자세 정보가 없는 입력에서도 시점을 조절합니다. 이미지 편집 모델을 기반으로 하며 객체 좌표계를 설명하는 텍스트와 방향이 정렬된 데이터셋을 함께 사용해 좌표 모호성과 미관측 범주에 대한 일반화 문제를 줄였습니다. 본문에 구체적인 수치는 없지만, 다양한 객체에서 방향 일관성과 이미지 품질·충실도 기준 state-of-the-art 결과를 기록했다고 보고됐습니다.
빠른 이해
새로운 점
자세 정보가 없는 소수의 입력 이미지에서 NOCS의 목표 절대 카메라 자세만으로 새로운 시점을 제어하고, 이미지 편집 모델과 좌표계 텍스트 정의를 결합했습니다.
핵심 메커니즘
자세 정보가 없는 한 장 또는 소수의 입력 이미지와 NOCS의 목표 절대 카메라 자세를 받아 camera token과 객체 기준 좌표계 텍스트를 멀티모달 조건으로 결합한 뒤, 이미지 편집 모델이 목표 방향의 새로운 시점 이미지를 생성합니다.
섹션별 상세
전역 시점 제어의 한계
NOCS 기반 카메라 제어
이미지 편집 모델과 데이터 구성
다양한 객체에서의 결과
용어 해설
- 새로운 시점 합성(Novel View Synthesis)
- — 한 장 또는 여러 장의 입력 이미지에서 관측하지 않은 시점의 장면 이미지를 생성하는 컴퓨터 비전 기술입니다. 사용자가 원하는 카메라 위치를 지정하면 객체를 다른 방향에서 본 모습으로 재구성하지만, 기존 방법은 입력 이미지에 상대적인 자세나 제한된 전역 시점만 지원해 정밀한 제어가 어려웠습니다.
- 정규화 객체 좌표 공간(Normalized Object Coordinate Space)
- — 객체의 기준 방향과 위치를 일관된 좌표계로 표현하는 공간입니다. Exo2EgoPolicy는 이 좌표계에서 목표 카메라의 절대 자세를 지정해 입력 이미지의 촬영 자세를 몰라도 원하는 시점으로 변환하며, 텍스트로 객체의 표준 좌표계를 함께 정의해 좌표 모호성을 줄입니다.
- 카메라 자세(Camera Pose)
- — 장면을 촬영하는 카메라의 위치와 방향을 뜻합니다. 기존 새로운 시점 합성 방법은 입력 이미지와 목표 시점 사이의 상대 자세 또는 입력 이미지의 카메라 자세를 요구했지만, 이 방법은 정규화 객체 좌표 공간의 목표 시점 절대 자세만 사용해 전역적이고 직관적인 시점 제어를 수행합니다.
- 맥락 내 멀티모달 조건화(In-context Multi-modal Conditioning)
- — 이미지와 텍스트 같은 여러 입력 양식을 하나의 맥락으로 결합해 생성 모델의 출력을 조절하는 방식입니다. 이 연구는 카메라 정보를 전용 camera token으로 삽입하고 객체의 기준 좌표계를 설명하는 텍스트를 추가해 목표 방향과 객체 의미를 함께 전달합니다.
기술
- Exo2EgoPolicy
- Novel View Synthesis
- NVS
- Normalized Object Coordinate Space
- NOCS
- image editing models
- camera tokens
- in-context multi-modal conditioning
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.