본문으로 건너뛰기

NOCS 기반 전역 카메라 제어 새 시점 합성

NOCS의 절대 카메라 자세와 camera tokens로 촬영 정보가 없는 이미지의 새 시점을 제어하는 Amazon Science 연구입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Novel View Synthesis는 입력 이미지에 없는 물체 시점을 생성하지만, 기존 방식은 입력 상대 좌표나 제한된 전역 시점 때문에 목표 방향을 직접 제어하기 어려웠습니다. 이 연구는 Normalized Object Coordinate Space에서 목표 시점의 절대 카메라 자세만 사용하고, 이를 전용 camera tokens로 이미지 편집 모델에 전달합니다. 물체의 canonical coordinate frame을 정의하는 텍스트와 방향이 정렬된 데이터셋을 함께 사용해 NOCS의 좌표 모호성과 미관측 범주 일반화 문제를 보완했습니다. 실험에서는 다양한 범주의 촬영 정보 없는 이미지에서 방향이 일관된 새 시점을 생성했으며, 이미지 품질과 원본 충실도에서 state-of-the-art 결과를 기록했습니다.

빠른 이해

새로운 점

입력 이미지의 상대적 카메라 자세 대신 NOCS의 절대 목표 자세를 사용하고, 이미지 편집 모델과 NOCS 텍스트 정의를 결합해 전역 시점을 제어합니다.

핵심 메커니즘

촬영 자세가 없는 단일 또는 소수의 입력 이미지와 목표 시점의 NOCS 절대 카메라 자세를 입력으로 받아 camera tokens와 물체의 canonical coordinate frame을 설명하는 텍스트를 멀티모달 조건으로 결합합니다. 이를 이미지 편집 모델에 전달해 입력 물체의 외형과 기준 방향을 유지한 새 시점 이미지를 출력합니다.

섹션별 상세

01

전역 시점 제어의 한계

Novel View Synthesis는 한 장 또는 여러 장의 이미지에서 보지 못한 시점의 장면이나 물체 이미지를 생성해 사용자가 다양한 방향에서 대상을 살펴볼 수 있게 합니다. 그러나 기존 방식은 입력 이미지에 상대적인 카메라 자세를 사용하거나 드문드문 배치된 전역 시점만 생성해 목표 방향을 직관적으로 지정하기 어려웠습니다. 이 제약은 NVS를 3D 탐색 외의 후속 작업에 활용하는 범위를 좁히는 원인이 됩니다.
02

NOCS 기반 카메라 조건화

연구진은 정규화 객체 좌표 공간인 NOCS 안에서 목표 시점의 절대 카메라 자세만 사용하는 생성 방식을 구축했습니다. 입력 이미지의 카메라 자세나 별도의 상대적 world frame을 요구하지 않으므로, 단일 또는 소수의 촬영 정보가 없는 이미지에서도 목표 방향을 지정할 수 있습니다. 카메라 정보는 in-context multi-modal conditioning 과정에서 전용 camera tokens로 주입되며, NOCS의 기준 방향이 모호해지는 문제는 물체의 canonical coordinate frame을 명시하는 텍스트 설명으로 보완합니다.
03

이미지 편집 모델과 데이터 구성

기존 NVS를 독립적인 이미지 생성 문제로 처리하는 대신 이미지 편집 문제로 재구성하고, 일반화 성능이 높은 최신 editing model을 기반으로 삼았습니다. 물체의 방향을 일관되게 맞춘 고품질 데이터셋과 각 물체의 NOCS 정의에 해당하는 텍스트를 함께 구성해 학습 조건을 통일했습니다. 연구진은 다양한 물체 범주와 임의의 촬영 정보 없는 입력 이미지에서 정확하고 일관된 방향의 새 시점을 생성했으며, 실험 결과 이미지 품질과 원본 충실도에서 state-of-the-art 수준을 기록했습니다.

용어 해설

새 시점 합성(Novel View Synthesis)
한 장 또는 여러 장의 입력 이미지에서 관측하지 않은 물체·장면의 시점을 생성하는 기술입니다. 카메라 위치와 방향을 바꾼 결과 이미지를 만들어 3D 탐색과 시각화에 활용할 수 있습니다.
정규화 객체 좌표 공간(Normalized Object Coordinate Space)
물체마다 제각각인 실제 좌표 대신, 물체의 기준 방향과 위치를 정규화해 공통 좌표계로 표현하는 방식입니다. 이 좌표계의 절대 카메라 자세를 사용하면 입력 이미지의 촬영 조건과 무관하게 목표 시점을 지정할 수 있습니다.
카메라 토큰(Camera Tokens)
카메라 위치와 방향 정보를 모델 입력에 전달하는 전용 토큰입니다. 이 연구에서는 이미지와 텍스트를 함께 조건으로 사용하는 in-context multi-modal conditioning 과정에 카메라 정보를 삽입해 목표 시점에 맞는 이미지를 생성합니다.
인컨텍스트 멀티모달 조건화(In-context Multi-modal Conditioning)
이미지·텍스트·구조화된 카메라 정보를 하나의 맥락으로 묶어 생성 모델의 출력 조건으로 사용하는 방식입니다. 서로 다른 정보원을 동시에 제공해 시점, 물체의 기준 좌표, 시각적 외형을 함께 제어합니다.

기술

  • Novel View Synthesis (NVS)
  • Normalized Object Coordinate Space (NOCS)
  • Diffusion modeling
  • Generative AI
  • Multimodal interaction
  • 3D modeling / imaging
  • Synthetic data generation
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 14.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.