왜 중요한가
단일 이미지에서 탐색 가능한 3D 장면을 만들려면 시야 밖 표면과 정확한 지오메트리가 필요하다. FLAT은 대규모 video diffusion 모델의 latent를 단일 전달로 삼각형 기반 표면 프리미티브로 직역(직접 복원)해, 실시간 렌더링과 게임 엔진 호환성에 맞는 기하학적 정확도를 확보한다.
핵심 기여
비디오 diffusion latent에서 직접 삼각형 프리미티브를 단일 패스로 복원
FLAT은 frozen camera-conditioned video diffusion 모델의 denoised latent를 입력으로 받아 feedforward scene decoder가 삼각형 스플랫(triangle splats) 파라미터를 한 번의 전달로 예측한다. 이 파이프라인은 per-scene 최적화 과정을 제거해 장면 생성의 계산 비용을 크게 낮춘다.
레이 중심 로컬 파라미터화와 Cholesky 스타일 shape로 안정성 확보
각 디코더 토큰은 광선(ray) 기준 로컬 프레임에서 깊이, 색, 불투명도, 세부 shape 파라미터를 예측한다. 2D canonical equilateral triangle에 lower-triangular 행렬 L을 적용해 대각 성분을 양수로 강제함으로써 면적이 양수인 삼각형만 생성되게 해 퇴화(degenerate) 해를 방지한다.
곱(window) 윈도우 함수로 경계 근처 그래디언트 흐름 개선
세 변의 정규화된 거리 응답을 clamp 후 곱하고 σ로 sharpness를 제어하는 product window function을 도입해, 삼각형 바깥쪽에서도 미분이 존재하도록 만들었다. max 기반 윈도우보다 경계 근처의 그래디언트 신호를 라우팅해 초기 학습 안정성이 개선된다.
경량 후처리로 실시간 렌더링 가능한 불투명 메시에 변환
예측된 반투명(triangle soup)에 대해 깊이·색·불투명도 정제와 50회 공격적 opacity 선택, 경계 근처 로컬 조밀화 및 정점 병합/프루닝을 수행해 불투명한 게임 엔진 호환 메쉬로 빠르게 변환한다.
동일 학습 설정에서 3DGS/2DGS/삼각형 표현의 체계적 비교
동일한 training pipeline과 하이퍼파라미터로 3DGS, 2DGS, triangle-splat 변형을 학습·평가해 표현 간 품질-지오메트리-엔진 호환성 트레이드오프를 정량적으로 분석했다.
핵심 아이디어 이해하기
출발점과 기존 한계: 이미지 기반 novel-view/scene generation은 입력으로부터 완전한 표면을 복원해야 하므로 강한 기하학적 prior가 필요하다. 기존 feedforward latent decoding은 보통 volumetric 3D Gaussian Splatting(3DGS)에 의존하는데, 3DGS는 부드러운 반투명 볼륨 특성으로 픽셀 복원에는 유리하지만 명확한 표면 표현과 그래픽스 파이프라인 호환성(mesh 추출 등)에 한계가 있다. 반면 삼각형/메시는 그래픽스 엔진에서 표준으로 쓰이지만, flat primitive는 잘못된 방향성에 의해 렌더 기여가 거의 사라져 학습 시 그래디언트가 희박해지는 문제가 있다.
방법론
전체 접근과 핵심 아이디어: 입력 단일 RGB 이미지와 목표 카메라 궤적을 받아, 카메라 조건화된 frozen video diffusion 모델(Uni3C 기반)으로부터 denoised latent z를 얻는다 → 이 latent와 카메라 임베딩(RPPC)을 합쳐 scene decoder가 삼각형 스플랫 파라미터(깊이, 색, 불투명도, sharpness, 2D shape transform, 잔여 회전 등)를 예측해 월드 좌표로 변환한다. 이 과정은 단일 feedforward 패스이며 per-scene 최적화가 필요 없다.
핵심 메커니즘 상세: 삼각형 파라미터화는 ray-centered local frame에서 이루어진다. 각 토큰은 anchor ray(원점 r_o, 방향 r_d)에 대해 깊이 D를 예측해 삼각형 중심 r_o + D⋅r_d를 정한다. 2D 기하학은 canonical 정삼각형에 lower-triangular matrix L=[L00 0; L10 L11]를 적용한다 → diagonal 성분 L00,L11을 양수로 강제해 면적>0을 보장한다. 회전은 레이 정렬 프레임에 대한 두 개의 tilt residual과 in-plane spin으로 분해해 예측한다. 윈도우 함수는 각 변의 signed distance L_{m,i}(p)를 삼각형 incenter의 inradius ρ_m로 정규화해 u_{m,i}(p) = -L_{m,i}(p)/ρ_m을 얻는다 → clamp(u+ε,0,1)=r_{m,i}(p)을 계산한 뒤 I_m(p) = (Π_i r_{m,i}(p))^{σ_m}을 취해 픽셀 커버리지를 계산한다. 이 방식은 세 변 모두에서 기여를 받아 경계 너머에서도 미분을 제공한다.
학습 및 구현 세부: decoder는 Wan-2.1 VAE의 RGB 디코더 백본을 전이학습해 사용하고, 카메라 정보는 Plücker→RPPC 임베딩을 VAE 인코더로 투영한 dense camera embedding으로 주입(제로-초기화 블록)한다. 출력은 2×2 픽셀 영역당 하나의 삼각형 토큰을 예측하도록 마지막 업샘플링 단계 제거로 축소한다. 훈련은 4단계로 해상도(320p→768p)를 점진적으로 올리며, AdamW lr=1e-4로 8 H100에서 200k iterations 학습했다. 손실은 pixel L2, LPIPS, scale-invariant disparity, normal cosine loss(α>0.5 마스크) 및 opacity regularization의 가중합이다.
관련 Figure

윈도우 함수 비교는 product window가 경계 바깥쪽에도 연속적인 기여와 비제로 미분을 제공해 경계 근처에서의 그래디언트 흐름을 개선한다는 수치적·시각적 근거를 제공한다. 이 차이는 학습 초기의 안정성과 전체 품질 개선으로 연결된다.
sigmoid 기반, max 기반, 논문에서 제안한 product(window) 함수의 화면상 응답 맵 비교를 제시한다.
주요 결과
메인 벤치마크: RealEstate10K와 DL3DV에서 FLAT의 세 표현 중 3DGS 변형은 가장 높은 시각적 품질(예: FLAT 3DGS PSNR 22.39, SSIM 0.762, LPIPS 0.203)을 기록했다. 삼각형 표현(FLAT Triangles)은 시각적 지표에서 경쟁력 있는 값을 유지하면서 지오메트리 정확도에서 우수했다(RealEstate10K+DL3DV 평균 Cosine 0.853; 2DGS는 0.587).
Ablation: ray-centered rotation parameterization과 product window function 조합이 학습 안정성과 최종 품질에 결정적 영향을 미쳤다. World-space 회전을 직접 예측하면 학습 불안정 또는 발산이 관찰되었고, 원래 max 기반 윈도우로 되돌리면 경계 근처 그래디언트가 약해졌다.
메시 변환(효율성·호환성): FLAT의 후처리로 얻은 불투명 메시는 RealEstate10K에서 PSNR 21.23(0.5M vertices)으로, 3DGS→GS2Mesh(4M verts) 결과(PSNR 14.18)에 비해 약 7 dB 이상 개선을 보였다. 따라서 삼각형 예측은 downstream 엔진 호환 메쉬 추출에서 큰 이득을 제공한다.
관련 Figure

이 Figure는 FLAT 파이프라인이 frozen video latent를 입력으로 해 feedforward로 삼각형 스플랫을 예측하고, 이를 통해 원본 입력 너머의 novel view를 렌더링한다는 점을 직관적으로 보강한다. 특히 중간에 나타난 normal/geometry 시각화는 삼각형 표현이 3DGS 대비 더 뚜렷한 표면 구조를 복원함을 뒷받침한다.
입력 뷰, 예측된 법선/Novel view 렌더링을 나란히 제시해 FLAT가 단일 이미지에서 삼각형 기반 장면을 생성해 novel view를 합성하는 결과를 보여준다.
기술 상세
전체 아키텍처: 파이프라인은 frozen camera-conditioned video diffusion (Uni3C built on Wan-2.1)으로부터 denoised video latent z(F'×C'×H'×W')를 얻고, pretrained VAE의 RGB decoder 백본을 수정한 feedforward scene decoder가 이를 입력으로 받아 triangle-splat 파라미터를 예측한다. 카메라 조건화는 RPPC(Plücker 변형)를 VAE 인코더로 인코딩한 dense camera embedding E^{cam}을 zero-initialized fusion으로 디코더에 주입한다.
핵심 메커니즘의 수학적 기반: 삼각형 2D shape는 canonical equilateral triangle을 lower-triangular matrix L로 변환한다. [입력] canonical triangle의 2D 좌표와 L의 요소(L00,L10,L11) → [연산] 행렬 곱으로 좌표 변환, 대각 성분을 양수로 강제 → [결과] 변형된 2D 삼각형이 생성되며 면적이 항상 양수 → [의미] 퇴화된(면적0) 해를 원천적으로 배제해 학습 안정성 확보. 윈도우 함수는 각 픽 p에 대해 [입력] 삼각형의 각 변에 대한 signed distance L_{m,i}(p) 및 inradius ρ_m → [연산] u_{m,i}(p)=-L_{m,i}(p)/ρ_m, r_{m,i}=clamp(u+ε,0,1), I_m(p)=(Π_i r_{m,i})^{σ_m} → [결과] 픽셀별 부드러운 커버리지 I_m(p) → [의미] 세 변 모두로부터 기여가 라우팅되어 경계 근처에서도 안정적인 그래디언트를 제공.
Prior work 대비 차별점: 기존 latent→3D feedforward 작업은 3DGS(가우시안) 표현에 의존해 시각적 fidelity는 높았으나 표면 명확성과 엔진 호환성이 낮았다. FLAT은 비볼류메트릭(flat) 삼각형을 직접 예측함으로써 표면 명확성(surface fidelity)과 메시 추출의 안정성을 개선했다. 수치적으로 삼각형 모델은 Metric3D-v2 기준 Cosine 0.853으로 2DGS(0.587)보다 지오메트리 정확도가 높았다.
구현·학습 세부사항: Uni3C는 49~81 프레임을 432×768 해상도로 생성하며 VAE는 시간 r_t=4, 공간 r_s=8로 다운샘플링한다. 학습은 4단계 progressive 해상도(최대 768p)로 수행했고, AdamW lr=1e-4, 8×H100, 200k iterations를 사용했다. 목표 손실은 ℒ=λ_rgb ℒ_2 + λ_perc ℒ_LPIPS + λ_D ℒ_D + λ_N ℒ_N + λ_O ℒ_O(λ_rgb=1.0, λ_perc=0.5, λ_D=0.01, λ_N=0.01, λ_O=0.001)이다. 후처리 단계는 σ 초기값 0.5로 시작해 깊이·색·불투명도 정제, 50회 opacity selection을 수행하고 경계 근처 로컬 densify·stitch·prune를 거쳐 opaque mesh를 생성한다.
관련 Figure

이 Figure는 삼각형 기반 표현이 normal map에서 더 선명하고 구조적인 법선을 회복해 지오메트리 정확도가 높음을 시각적으로 보여준다. 결과적으로 삼각형 표현이 mesh 추출/엔진 호환성 측면에서 유리함을 보강한다.
동일 장면에서 3DGS, 2DGS, Triangle Splatting의 렌더ed 이미지와 normal map을 비교한 결과를 제시한다.
한계점
논문에 명시된 한계: (1) 삼각형 표현은 파라미터화·렌더링 설계에 매우 민감해 안정적 학습을 위해 ray-centered rotation과 product window가 필요하다. (2) 지오메트리 감독에 NormalCrafter 등 pseudo-ground-truth normals를 사용해 해당 예측의 한계가 전체 품질에 영향준다. (3) Uni3C의 생성 카메라와 실제 입력 카메라가 완전히 일치하지 않아 MapAnything로 궤적 보정이 필요했고, 이는 전처리/후처리 의존도를 의미한다.
실무 활용
FLAT 출력은 빠른 후처리(깊이·불투명도 정제, opacity 이진화, 경계 병합)로 게임 엔진에 바로 넣을 수 있는 불투명 삼각형 메쉬로 변환된다. feedforward 특성 때문에 per-scene 최적화 비용이 없어 대규모 배치 또는 실시간 애플리케이션에 유리하다.
- 게임 자산 자동 생성: 단일 이미지에서 엔진 호환 메쉬를 빠르게 생성해 레벨 프로토타이핑에 활용
- 로봇 시뮬레이션 초기 장면 구성: 시뮬레이터에 투입 가능한 불투명 표면과 법선 제공
- 혼합현실 콘텐츠 제작: 입력 사진 기반으로 실시간에 가까운 장면 확장 및 뷰 합성
- 데이터 증강 파이프라인: 다양한 카메라 궤적에 대한 대규모 합성 뷰 생성
코드 공개 여부: 미확인
키워드
용어 해설
- 삼각형 스플래팅(Triangle Splatting)
- — 화면 상의 각 픽셀에 대해 부드러운(soft) 커버리지를 계산하는 방식으로 삼각형을 렌더링하는 미분가능한 표현이다. 픽셀 단위로 엣지 거리 또는 정규화된 엣지 응답을 계산한 뒤 윈도우 함수로 부드럽게 처리해 합성(alpha-compositing)하면 이미지가 생성되며, 경계 근처에서도 미분이 존재해 optimization/learning이 가능하다.
- 3D 가우시안 스플래팅(3D Gaussian Splatting)
- — 장면을 이방성(anisotropic) 3D 가우시안의 집합으로 표현해 실시간 렌더링을 가능하게 하는 표현이다. 각 가우시안은 반투명 볼륨 특성을 가져 픽셀 합성에 기여하므로 픽셀 단위 재구성에는 유리하지만 명확한 표면(surface) 추출에는 한계가 있다.
- 레이 중심 회전 파라미터화(Ray-centered Rotation Parameterization)
- — 삼각형 중심을 카메라 광선(ray)에 정렬한 로컬 프레임에서 삼각형의 방향을 잔여 회전(residual rotation)으로 예측하는 방식이다. 월드 공간 전체 회전 대신 레이 정렬 프레임을 기준으로 회전을 예측하면 방향 오류로 인한 기하학적 소실을 완화해 안정적인 그래디언트 흐름을 확보한다.
- 곱 윈도우 함수(Product Window Function)
- — 삼각형의 각 변에 대한 정규화된 거리 응답을 클램프한 뒤 세 변의 응답을 곱하고 sharpness 지수(σ)를 취해 픽셀 커버리지를 계산하는 윈도우 함수다. max 기반 창과 달리 세 변 모두로부터 기여를 받으므로 경계 바깥쪽에서도 미분이 존재해 초기 학습 안정성을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.