본문으로 건너뛰기

CGGS: 일관성 증강 기하학적 가우시안 스플래팅을 통한 에고 중심 3D 장면 생성

CGGS는 일관성 증강된 MV-LDM, 흐름 기반 레이아웃 초기화, MID 기반 3D Gaussian 정제를 결합하여 CLIP Score 26.253과 PSNR 37.345을 달성하며 에고 중심 텍스트-주도 3D 장면 재구성 성능을 향상시켰다.

용어 해설

잠재 확산 모델(Latent Diffusion Model)
이미지를 고차원 픽셀 공간 대신 학습된 잠재 공간으로 압축한 뒤, 그 잠재 벡터에 잡음을 더하고 역으로 제거하는 과정을 학습하는 생성모델로서, 본 논문에서는 다중 시점 조건으로 이미지의 일관성을 유지하며 텍스트로부터 2D 프라이어를 생성하는 핵심 구성 요소로 활용된다.
대응 인지 어텐션(Correspondence-Aware Attention (CAA))
여러 시점의 피처 맵을 동시에 처리하여 서로 대응되는 지역을 찾는 교차-어텐션 블록으로서, 시점 간 위치 차이를 위치 인코딩으로 보정하고 다중 뷰 일관성을 강화하기 위해 MV-LDM 구조에 통합되어 사용된다.
상호정보 기반 깊이 손실(Mutual Information Depth Loss (MID))
렌더링된 깊이 분포과 참조 깊이 분포 사이의 통계적 의존도를 측정하는 상호정보량을 목적함수로 사용하여 깊이의 비선형 관계와 고주파 구조를 보존하도록 유도하는 손실 함수로, Pearson 기반 손실이 과도한 평활화를 야기하는 문제를 완화한다.
광학 흐름(Optical Flow)
연속 프레임 간의 픽셀 이동 벡터 필드를 추정하는 기법으로서, 본 논문에서는 인접 에고 중심 뷰 사이의 픽 대응을 얻어 장면의 상대적 기하 정렬과 깊이 업데이팅에 제약 신호로 활용한다.
포인트 트랙(Point Tracks)
여러 프레임에 걸쳐 동일한 3D 포인트가 이미지 상에서 추적된 일련의 2D 좌표들로서, 단기 흐름이 누적 오차를 만들 때 장기 일관성을 회복하기 위한 제약으로 사용되어 깊이 추정의 스케일 및 정렬을 보정한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 04.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.