왜 중요한가
기존의 NeRF나 Gaussian Splatting 방식은 새로운 장면마다 수 분 이상의 재학습이 필요해 실시간 스트리밍에 부적합했다. 이 논문은 별도의 재학습 없이 3대의 카메라 입력만으로 즉시 고품질의 자유 시점 영상을 생성할 수 있는 피드포워드 구조를 제안하여 AR/VR 및 텔레프레즌스 대중화의 기술적 토대를 마련했다.
핵심 기여
델로네 삼각분할 기반의 최적 시점 선택
카메라 위치를 원통형 표면에 투영한 뒤 Delaunay Triangulation을 수행하여, 임의의 타겟 시점을 합성하는 데 가장 적합한 3개의 참조 카메라 조합을 기하학적으로 선택함으로써 데이터 중복성을 제거했다.
Coarse-to-Fine 피라미드 깊이 추정 아키텍처
7단계의 피라미드 구조를 통해 저해상도에서 전역적 구조를 잡고 고해상도에서 세부 깊이를 정밀화하는 방식을 채택하여, 연산 비용을 획기적으로 낮추면서도 정교한 깊이 맵을 생성했다.
GhostNet 기반의 경량 특징 추출 백본
연산 효율이 높은 Ghost Module을 활용하여 실시간 처리에 적합한 경량 백본을 설계했으며, 이를 통해 1024x1024 해상도에서 40 FPS 이상의 추론 속도를 확보했다.
관련 Figure

임의의 타겟 시점을 합성하기 위해 어떤 소스 카메라 3개를 선택해야 하는지에 대한 수학적 근거를 제공한다. 원통형 투영을 통해 깊이 편향을 제거하고 안정적인 삼각형 메시를 형성하는 과정을 보여준다.
카메라 위치를 원통형 표면에 투영하고 Delaunay Triangulation을 수행하는 기하학적 과정을 시각화한 도표이다.
핵심 아이디어 이해하기
기존의 시점 합성 방식은 공간 전체를 학습하거나(NeRF), 수많은 점 구름을 최적화(Gaussian Splatting)해야 하므로 실시간성이 부족했다. 3DTV는 이를 해결하기 위해 '이미지 보간'이라는 고전적 개념을 딥러닝의 특징 추출(Feature Extraction)과 결합했다.
먼저, 무수히 많은 카메라 데이터 중 타겟 시점을 둘러싼 가장 가까운 3개의 카메라만 선택하여 연산량을 줄인다. 이때 단순히 거리만 따지는 것이 아니라 Delaunay Triangulation을 통해 기하학적으로 가장 안정적인 삼각형 배치를 가진 카메라들을 고른다.
추출된 특징들은 '깊이 피라미드'를 통해 단계적으로 처리된다. 낮은 해상도에서 대략적인 물체의 위치(깊이)를 파악하고, 이를 상위 단계로 전달하며 세부적인 윤곽을 다듬는 Residual Learning 방식을 사용한다. 이는 마치 화가가 큰 붓으로 구도를 잡고 작은 붓으로 묘사하는 것과 같은 원리로, 전체 연산량을 N²에서 선형적인 수준으로 억제하면서도 고해상도 결과를 얻게 한다.
방법론
전체 파이프라인은 시점 선택, 특징 추출, 깊이 추정, 특징 융합의 4단계로 구성된다. 시점 선택 단계에서는 카메라 좌표 p_i를 원통 모델에 투영하여 2D 평면상에서 Delaunay Triangulation을 수행하고, 타겟 시점 q를 포함하는 삼각형의 정점에 해당하는 3개의 소스 카메라를 결정한다.
특징 추출 단계에서는 GhostNetV2 아키텍처를 기반으로 7단계의 특징 피라미드 {F_i^l}를 생성한다. 각 단계는 Ghost Bottleneck을 통과하며 채널 수를 억제하면서도 풍부한 시맨틱 정보를 유지한다. 마지막 레이어에는 L-ASPP(Lightweight Atrous Spatial Pyramid Pooling)를 적용하여 다양한 스케일의 컨텍스트를 수집한다.
깊이 추정 단계에서는 Plane-sweep Stereo 원리를 사용한다. 이전 단계의 깊이 예측값 D^(l+1)에 로컬 윈도우 오프셋 δ를 더해 D^l = {D^(l+1) + δ}를 계산한다. [이전 단계의 깊이 값과 오프셋 범위를 입력으로] → [현재 단계의 후보 깊이 평면들을 생성하여] → [각 평면에서의 특징 일치도를 계산하고] → [최적의 깊이 수정값 Δl을 도출한다].
최종 융합 단계에서는 추정된 깊이 D^l과 투명도 A^l을 사용하여 소스 특징들을 타겟 시점으로 워핑한다. 각 시점별 신뢰도 가중치 W_i^l을 계산하여 F_fused = Σ W_i * F_warped 연산을 수행한다. [워핑된 특징과 기하학적 메타데이터를 입력으로] → [픽셀 단위 가중치 합산을 수행하여] → [융합된 잠재 특징 Z^l을 얻고] → [이를 디코딩하여 최종 RGB 이미지를 생성한다].
관련 Figure

왼쪽의 GhostNet 기반 백본에서 특징을 추출하고, 중앙의 상관관계 블록을 통해 단계별로 깊이를 정밀화하며, 오른쪽에서 최종 이미지를 합성하는 흐름을 명확히 제시한다. 이는 실시간 처리를 위한 계층적 구조의 핵심을 설명한다.
3DTV의 전체 네트워크 아키텍처 다이어그램으로 특징 추출, 깊이 추정, 특징 융합 과정을 보여준다.
주요 결과
MVHumanNet 및 ZJUMoCap 등 인체 캡처 데이터셋에서 기존 실시간 SOTA 모델인 GPS-Gaussian+ 대비 PSNR 기준 약 1.5~3.0dB 높은 성능을 기록하며 화질 우위를 입증했다. 특히 2개의 카메라만 사용하는 기존 방식들과 달리 3개 시점을 기하학적으로 활용함으로써 팔다리 등 돌출된 부위의 고스트 현상(Ghosting Artifacts)을 크게 줄였다.
속도 측면에서는 NVIDIA RTX 4090 GPU에서 TensorRT 최적화를 적용했을 때 1024x1024 해상도 기준 24.5ms(약 40.8 FPS)의 추론 속도를 달성했다. 이는 실시간 인터랙티브 애플리케이션의 요구 사항인 30 FPS를 상회하는 수치이다.
Ablation Study를 통해 7단계 피라미드 구조와 Residual Depth 학습의 중요성을 확인했다. Residual Depth를 제외할 경우 PSNR이 25.9에서 21.5로 급격히 하락하여, 단계별 미세 조정이 고품질 합성에 필수적임을 증명했다.
관련 Figure

기존 방식(ENeRF, GPS-Gaussian+)에서 발생하는 고스트 현상이나 기하학적 왜곡이 3DTV에서는 현저히 줄어들었음을 시각적으로 증명한다. 특히 복잡한 인체 동작에서도 세부 디테일이 잘 유지됨을 보여준다.
다양한 데이터셋(RIFTCast, DNA, THuman2.1, LLFF)에서 타 모델과 3DTV의 합성 결과를 비교한 이미지이다.
기술 상세
3DTV는 장면별 최적화(Per-scene optimization)를 제거하기 위해 일반화된 깊이 추정 네트워크를 핵심으로 한다. 아키텍처는 크게 GhostNet 기반의 백본과 계층적 깊이 추정 모듈, 그리고 특징 융합 디코더로 나뉜다. 깊이 추정 시 Group-wise Correlation을 사용하여 채널을 G개의 그룹으로 나누어 상관관계를 계산함으로써 연산 효율과 매칭 정확도 사이의 균형을 맞췄다.
학습 시에는 L1 Reconstruction Loss, RGB Pyramid Loss, Masked L1 Depth Loss, Offset Loss, Alpha Loss, VGG Perceptual Loss, Style Loss 등 총 7가지 손실 함수를 조합한 Multi-task Learning을 수행한다. 특히 Offset Loss는 예측된 깊이 수정값 Δl이 지정된 윈도우 범위 ϵl 내에 머물도록 강제하여 학습의 안정성을 높인다.
구현 측면에서 TensorRT의 Bfloat16(BF16) 정밀도를 활용하여 메모리 점유율을 2.2GB 수준으로 낮췄으며, 이는 고해상도(2K) 처리 시에도 8GB 내외의 VRAM만으로 구동 가능하게 한다. 또한 합성 데이터셋(357개 3D 에셋 기반)만으로 학습했음에도 불구하고 실제 환경(LLFF 등)에서 강력한 일반화 성능을 보여준다.
한계점
현재 모델은 3개의 입력 카메라 시나리오에 최적화되어 있어, 대규모 야외 장면이나 카메라가 매우 멀리 떨어진 환경에서는 깊이 추정의 정확도가 떨어질 수 있다. 또한 복잡한 텍스처가 반복되는 영역에서는 여전히 약간의 블러(Blur) 현상이 발생하며, 시점 외삽(Extrapolation) 범위가 넓어질 경우 품질이 저하되는 한계가 있다.
실무 활용
재학습이 필요 없는 피드포워드 방식이므로 다채널 카메라 시스템을 이용한 실시간 라이브 스트리밍 및 화상 회의 시스템에 즉시 적용 가능하다.
- 실시간 3D 텔레프레즌스: 원격 회의 시 참가자의 모습을 자유로운 각도에서 입체적으로 송출
- VR/AR 스포츠 중계: 경기장에 설치된 소수의 카메라 데이터를 기반으로 시청자가 원하는 시점의 뷰를 실시간 생성
- 인터랙티브 가상 피팅: 사용자의 다각도 촬영 영상을 기반으로 실시간 3D 아바타 생성 및 의상 착용 시뮬레이션
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 신규 시점 합성(Novel View Synthesis)
- — 제한된 수의 입력 이미지로부터 학습되지 않은 새로운 각도에서의 시점 이미지를 생성하는 기술이다. 3D 공간의 기하학적 구조와 광학적 특성을 이해하여 가상 카메라의 위치에 따른 픽셀 값을 예측하는 것이 핵심이다.
- 델로네 삼각분할(Delaunay Triangulation)
- — 평면 위의 점들을 삼각형으로 연결하여 최소각을 최대화하는 분할 기법이다. 이 논문에서는 카메라 위치들을 기반으로 최적의 참조 카메라 3개(triplet)를 선택하여 기하학적으로 안정적인 보간 기반을 마련하는 데 사용된다.
- 평면 스윕 스테레오(Plane-Sweep Stereo)
- — 여러 시점의 이미지들을 가상의 깊이 평면들에 투영하여 시각적 일치도를 계산함으로써 깊이 정보를 추정하는 알고리즘이다. 3DTV는 이를 coarse-to-fine 방식으로 적용하여 연산 효율성을 극대화한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.