TL;DR
고차 Spherical Harmonics 사용은 Gaussian Splatting에서 시점 의존 조명을 표현하는 데 유리하지만 Gaussian당 큰 메모리와 대역폭을 요구해 모바일 배포에 제약을 만든다. Flux-GS는 고차 SH의 시점 의존 에너지를 몬테카를로로 압축하고 1차 SH와 속성 기반 보정을 결합해 추론 비용을 거의 늘리지 않으면서 저장공간과 렌더링 비용을 크게 낮췄다. 이 접근은 모바일에서의 실시간 고품질 신뷰 합성을 가능하게 하는 현실적 경량화 전략을 제공한다.
왜 중요한가
고차 Spherical Harmonics 사용은 Gaussian Splatting에서 시점 의존 조명을 표현하는 데 유리하지만 Gaussian당 큰 메모리와 대역폭을 요구해 모바일 배포에 제약을 만든다. Flux-GS는 고차 SH의 시점 의존 에너지를 몬테카를로로 압축하고 1차 SH와 속성 기반 보정을 결합해 추론 비용을 거의 늘리지 않으면서 저장공간과 렌더링 비용을 크게 낮췄다. 이 접근은 모바일에서의 실시간 고품질 신뷰 합성을 가능하게 하는 현실적 경량화 전략을 제공한다.
핵심 기여
Monte Carlo Specular Energy Aggregator를 통한 고차 SH 에너지 압축
Flux-GS는 고차(3차) SH와 2차 SH의 차이를 구면상의 균일 표본으로 샘플링해 각 방향에서의 광학적 잔차를 계산하고 그 크기(E_mag)와 방향(E_dir) 모멘트를 평균화해 저차(latent) 기술자로 압축했다. 이 압축된 에너지·방향 라텐트는 MLP Ψ로 매핑되어 1차 SH 계수 c'로 복원되며 별도의 사전 학습이나 교사-학생 distillation이 불필요하다. 결과적으로 Gaussian당 저장해야 할 SH 계수 수가 48에서 4로 줄어드는 효과가 발생한다.
Attribute-Conditioned SH Enhancement로 무추론 비용 고주파 보정
Gaussian의 정규화 위치, 스케일, 회전, 불투명도, 기초 1차 SH를 입력으로 하는 경량 MLP Φ를 통해 1차 SH 오프셋 Δc를 예측하고 이를 추론 전 명시적 파라미터에 베이크했다. Φ의 최종 선형층을 0으로 초기화해 초기 학습 단계에서 표준 표현으로 수렴하도록 설계했고, 오프셋은 한 번만 디코드되어 런타임 오버헤드를 만들지 않는다. 이로써 압축 과정에서 손실된 색상·구조적 세부를 보완하면서 모바일 성능을 유지했다.
Multi-view Alpha-based Densification and Pruning으로 원시요소 예산 제어
다중 뷰에서의 픽셀별 포토메트릭 손실을 누적해 이진 메트릭 맵을 만들고, 각 Gaussian의 알파 기여도를 합산해 중요도 S+와 가지치기 점수 S-를 계산했다. 이 점수들은 기존의 단일-뷰 그래디언트 기반 clone/split 마스크와 교차되어 클론·분할 조건을 보강하며, 불투명도 기준의 단순한 제거 대신 다중뷰 기반 분위기를 반영한 온건한 가지치기를 수행한다. 결과적으로 불필요한 Gaussian 수를 크게 줄여 저장과 렌더링 속도를 개선했다.
WebGL 기반 배포와 한 번만 디코드되는 1차 SH로 모바일 실시간 렌더링 달성
Flux-GS는 디코딩된 1차 SH 계수와 베이크된 오프셋만을 모바일에 보관하고 WebGL로 렌더링하며, 깊이 정렬은 비동기 WebWorker와 CPU를 활용한 분리된 소팅으로 처리해 120 FPS 제약을 돌파하는 오프스크린 벤치마크를 달성했다. 학습은 데스크탑에서 30k 반복까지 수행하되, 초기 3k 반복은 3차 SH로 고주파를 확보한 후 MC-SEA로 압축한다. GitHub 저장소와 데모 페이지를 통해 구현 코드가 공개되어 재현 가능성이 확보되어 있다.
핵심 아이디어 이해하기
3D Gaussian Splatting은 장면을 수백만 개의 비등방성 Gaussian으로 표현하고 SH 계수로 시점 의존 색상을 모델링해 높은 시각 품질을 얻는다. 그러나 3차 SH는 Gaussian당 48개의 실수 계수를 필요로 해 전체 원시요소 수가 커질수록 저장 공간과 메모리 대역폭이 급증한다. 이로 인해 모바일처럼 자원이 제한된 환경에서는 실시간 렌더링과 저장 비용이 큰 제약으로 작용한다. Flux-GS는 고차 SH가 포착하는 시점 의존 스펙큘러 정보의 본질을 에너지 크기와 우세 방향으로 요약할 수 있다는 관찰에서 출발한다. 해당 관찰을 바탕으로 구면상에서 균일 표본을 추출해 3차와 2차 SH의 차이를 계산하고 이 잔차의 양수 부분을 평균화해 크기(E_mag)와 방향 모멘트(E_dir)를 얻는다. 이 두 값은 시점 의존 에너지의 핵심 통계량으로 간주되어 저차 SH로의 복원을 가능하게 한다. 저차로의 압축은 그 자체로 색상·구조적 손실을 유발할 수 있으므로 Gaussian의 기하학적·광학적 속성에 의존하는 보정이 필요하다. Attribute-Conditioned SH Enhancement는 이러한 속성(정규화된 위치, 스케일, 회전, 불투명도, 기초 1차 SH)을 입력으로 받아 오프셋을 예측하고 이를 사전에 베이크함으로써 런타임 비용을 추가하지 않으면서도 손실된 고주파 특성을 복원한다. 이 결합으로 Flux-GS는 1차 SH만으로도 고주파 세부와 시점 의존 효과를 재현할 수 있다.
방법론
전체 파이프라인은 세 단계로 구성된다. 먼저 초기 학습 단계에서 3차 SH를 사용해 3k 반복 동안 고주파 표현을 확보한다. 다음으로 Monte Carlo Specular Energy Aggregator(MC-SEA)를 통해 3차 SH와 2차 SH의 차이를 구면상 K 표본으로 샘플링하여 각 표본 방향에서의 잔차 c_res(d_k)를 계산하고 그 양수 부분의 평균으로 E_mag와 E_dir를 얻는다. 획득한 E_mag와 E_dir, 및 정규화된 Gaussian 위치를 MLP Ψ에 입력해 1차 SH 계수 c'를 예측한다. 수학적으로는 표본화된 잔차들의 외적 및 평균 연산으로 방향 모멘트를 얻고, 이 저차 라텐트가 1차 SH 계수 공간으로 비선형 매핑된다. 이 매핑은 계수의 해석적 투영(내적)에 의해 버려지는 시점 의존 성분의 방향성과 크기를 보존하는 역할을 한다. 압축 후 보정은 Attribute-Conditioned SH Enhancement 모듈 Φ로 수행된다. Φ는 정규화된 위치, 스케일, 회전 쿼터니언, 불투명도, 기초 1차 SH를 연결해 입력으로 받고 경량 MLP를 통해 Δc를 예측한 다음 c_out = c' + Δc로 최종 계수를 만든다. Δc의 최종 선형층은 0으로 초기화되어 학습 초기에 안정적으로 표준 표현으로 수렴하도록 설계되어 있으며, 모든 보정 오프셋은 추론 전 한 번만 디코드·베이크된다. 다중뷰 기반의 densification과 pruning은 Stratified Camera Sampling으로 대표 뷰를 선정하고, 각 뷰에서의 픽셀별 포토메트릭 손실을 통해 이진 메트릭 맵을 생성한 다음 Gaussian의 알파 기여를 누적해 중요도 S+와 가지치기 점수 S-를 계산한다. 이 점수들은 기존의 단일-뷰 그래디언트 기반 clone/split 마스크와 교차되어 덕타일한 클론·분할 결정을 유도하며, 가지치기는 불투명도 임계치와 S-의 분포 기반 분위수를 결합해 수행된다. 구현 측면에서 학습은 전체적으로 30k 반복을 기준으로 수행하며 초기 3k 반복만 3차 SH를 유지한다. 배포는 WebGL을 사용해 브라우저 상에서 실시간 렌더링을 수행하고 깊이 정렬은 비동기 WebWorker와 CPU를 활용한 분리 소팅으로 처리해 렌더링 루프 제약을 회피했다. 이러한 설계로 추론 단계에서는 단 한 번의 디코드와 베이크만이 필요해 런타임 메모리와 계산 부담을 최소화했다.
관련 Figure

이 그림은 초기 3차 SH 학습 후 구면 표본을 통해 고차 잔차를 집계하고 E_mag와 E_dir를 얻어 MLP로 1차 SH를 복원하는 전체 흐름을 시각화하고 있다. 또한 Attribute-Conditioned SH Enhancement가 Gaussian 속성을 입력으로 받아 오프셋을 생성하고 이를 베이크해 추론 단계에서 추가 비용이 없음을 도식적으로 연결해 보인다. Multi-view Alpha-based Densification 섹션은 stratified camera sampling과 알파 기반 중요도 누적이 어떻게 clone/split/prune 결정에 결합되는지를 보여주어 방법론 핵심을 보강한다.
Flux-GS 전체 파이프라인과 MC-SEA, Attribute-Conditioned SH Enhancement, 다중뷰 densification 흐름을 개략적으로 나타낸 다이어그램이다.
주요 결과
주요 벤치마크에서는 Flux-GS가 저장공간과 실시간 성능 측면에서 경쟁 기법들을 능가했다. Mip-NeRF 360의 Indoor 카테고리에서 Flux-GS는 PSNR 30.22, Gaussian 수 0.22×10^6, 저장공간 2.1 MB, 모바일 FPS 147, 학습 시간 11분을 달성했으며 이는 동일 범주의 기존 기법들보다 원시요소 수와 저장 요구량이 적고 FPS가 높았다. Outdoor 카테고리에서는 PSNR 24.45, Gaussian 수 0.48×10^6, 저장공간 4.6 MB, FPS 132, 학습 시간 11분으로 보고되었다. 다른 데이터셋에서도 유사한 효율-품질 균형을 보였다. Tanks and Temples에서 Flux-GS는 PSNR 23.27, SSIM 0.827, LPIPS 0.221, 저장공간 2.4 MB, FPS 137을 기록했고 Deep Blending에서는 PSNR 29.73, SSIM 0.898, LPIPS 0.275, 저장공간 1.9 MB, FPS 158을 기록했다. 이러한 수치는 Flux-GS가 저장공간을 크게 줄이면서도 시각적 품질 지표에서 경쟁력을 유지했음을 의미한다. 성분 기여 분석을 위한 ablation 결과에서는 MC-SEA 또는 Δc를 제거하면 재구성 품질이 저하되는 반면 효율성은 유사하게 유지되는 경향을 보였다. 반대로 다중뷰 densification 또는 pruning을 비활성화하면 Gaussian 수와 저장공간이 크게 증가하고 FPS가 감소해 다중뷰 전략이 표현 압축과 속도 향상에 핵심적임이 입증되었다.
관련 Figure

이 Figure는 Flux-GS가 같은 장면에서 훨씬 적은 Gaussian 수와 작은 저장공간으로도 고주파 디테일과 구조를 잘 보존하며 시각적으로 경쟁력 있는 결과를 내는 것을 보여준다. 각 패널의 확대 영역은 경계선, 텍스처, 기계적 디테일 영역에서 Flux-GS가 과도한 블러 없이 구조를 유지함을 보여주며, 하단의 표시는 메모리 및 Gaussian 수 감소라는 정량적 이점을 시각적으로 보강한다. 이 정성 비교는 표 형식의 벤치마크 결과와 결합해 Flux-GS의 효율-품질 균형을 증거로 보완한다.
다양한 장면에 대해 3DGS, Speedy-Splat, Mobile-GS, Flux-GS, 그리고 GT를 비교한 정성적 결과와 각 기법의 Gaussian 수 및 저장공간을 함께 제시한 비교 이미지 그리드이다.
기술 상세
전체 아키텍처는 초기 3차 SH 기반 최적화 단계, MC-SEA를 통한 라텐트 생성 및 1차 SH 디코드 단계, Attribute-Conditioned SH Enhancement로의 보정 단계, 그리고 다중뷰 기반 densification/pruning 루프를 포함하는 파이프라인으로 구성된다. 각 Gaussian은 위치 μ, 스케일 s, 회전 r, 불투명도 o, 그리고 SH 계수 c를 저장하며 최종적으로 베이크된 1차 SH와 보정 오프셋만이 런타임에 필요하다. 학습 중에는 전체 Gaussian 파라미터와 압축된 SH 표현을 공동 최적화한다. Monte Carlo 기반의 에너지 집계는 구면상 K개의 방향 d_k를 균일 표본화하고 각 방향에서의 고차 잔차 c_res(d_k)=c_i(d_k)-c_i^2(d_k)를 계산한다. 그 다음 E_mag=1/K Σ max(0,c_res(d_k))와 E_dir=1/K Σ d_k ⊗ max(0,c_res(d_k))를 계산해 에너지의 크기와 방향 모멘트를 얻는다. 이 연산은 입력 함수의 방향성(phase)과 양적인 영향력을 보존하므로, 정규적 SH 적분이 버리는 정보를 대체할 수 있다. SH 매핑은 MLP Ψ가 수행하며 입력으로 E_mag, E_dir, 정규화된 위치 f(μ̂)를 사용해 1차 SH 계수 c'를 출력한다. 정규화 함수 f는 위치 벡터의 노름이 1을 초과하면 특정 스케일링을 적용해 outlier의 영향력을 완화하며, 이로 인해 MLP 학습이 안정화된다. Attribute-Conditioned MLP Φ는 추가적으로 입력된 기하학적·광학적 속성으로 Δc를 산출해 c_out = c' + Δc를 만든다. 다중뷰 densification은 Stratified Camera Sampling으로 대표 뷰를 선정한 뒤, 각 뷰에서의 픽셀별 손실을 통해 생성된 메트릭 맵 M^{+}, M^{-}으로부터 가시성 가중치 α를 누적해 S^{+}, S^{-}를 계산한다. 최종 clone/split/ prune 마스크는 기존의 그래디언트 기준과 중요도 분위수 Q_τ를 결합해 결정되어 단일-뷰 기반의 과밀화를 방지한다. 이 과정은 CUDA 커널로 렌더링 파이프라인에 통합되어 효율적으로 수행된다. 학습과 배포 세부사항으로 학습은 전체 30k 반복을 기준으로 하고 초기 3k 반복 동안 3차 SH를 사용한다. MC-SEA 기반 압축은 한 번만 수행되어 이후에는 1차 파라미터만 유지·업데이트한다. 배포는 WebGL로 구현되어 브라우저 상에서 동작하며 깊이 정렬은 비동기 WebWorker와 CPU를 이용해 처리해 렌더링 루프의 병목을 완화했다.
한계점
논문은 고차 SH를 저차로 압축하는 과정에서 색상 충실도와 일부 구조적 디테일이 손실될 수 있음을 명시하고, 이를 보정하기 위해 Attribute-Conditioned SH Enhancement 모듈을 도입해 보정 오프셋을 베이크하도록 설계했다. 또한 Flux-GS는 초기 단계에서 3차 SH로 3k 반복을 수행해야 하므로 훈련의 일부는 고차 표현을 필요로 해 전처리 학습 부하가 완전히 사라지지는 않는다. 다중뷰 기반의 densification과정은 다수의 뷰를 샘플링하고 알파 기여도를 누적해야 하므로 학습 측면에서 추가적인 렌더링 비용과 복잡도가 발생할 수 있다.
실무 활용
Flux-GS는 저장공간과 추론 비용이 제한된 모바일·웹 환경에서 고품질 신뷰 합성을 제공하도록 설계되어 실무 적용 가능성이 높다. 베이크된 1차 SH와 베이크 오프셋만을 클라이언트에 배포하므로 네트워크 전송 및 런타임 메모리 요구량이 작다. 공개된 코드 저장소를 통해 데모와 재현이 가능하다.
- 모바일 및 웹 기반의 실시간 포토리얼리스틱 뷰어에서 대용량 장면을 경량화해 배포하는 용도
- AR/VR 경량 클라이언트에서 네트워크 대역폭을 줄이며 고품질 신뷰 합성을 제공하는 용도
- 로컬 디바이스에서의 대화형 장면 탐색 및 네비게이션 애플리케이션에서 저지연 렌더링을 제공하는 용도
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Spherical Harmonics
- — 구면 위의 각 방향을 다항식 기반 기저로 표현하는 함수군으로, 조명과 시점 의존 색상 변화를 저차원 계수로 근사하는 데 사용된다. 본문에서는 3차 SH가 세부적인 반사(specular)를 표현하지만 Gaussian당 많은 계수를 요구해 저장 및 대역폭 비용이 커졌다. Flux-GS는 이 에너지를 낮은 차수로 압축해 모바일 친화적 표현을 달성한다.
- 3D Gaussian Splatting
- — 장면을 다수의 비등방성 3D Gaussian 원시요소로 표현하고 볼륨 렌더링으로 합성하는 방식으로, 높은 품질의 실시간 뷰 합성을 가능하게 한다. 각 Gaussian은 위치, 스케일, 회전, 불투명도, SH 계수 등 속성을 지니며 이들 합성이 픽셀 색상을 만든다. 본 논문은 이 표현의 SH 비용과 원시요소 과다 문제를 경량화한다.
- Monte Carlo Projection
- — 구면에 균일 표본을 뿌리고 각 표본 방향에서의 고차 잔차를 계산하여 방향 모멘트를 추출하는 수치적 투영 방식이다. 본문에서는 3차 SH와 2차 SH의 차이를 표본화해 에너지 크기와 주된 방향을 계산하고 이를 낮은 차수 SH로 매핑하는 데 사용되었다. 이 방식은 직교 성질 때문에 직접적 다항 합산이 무의미한 경우에 유효한 대체 표현을 제공한다.
- Alpha-weighting
- — 각 Gaussian이 픽셀에 기여하는 투과도(alpha)를 가중치로 삼아 다수의 뷰에서 오류를 역투영하는 기법이다. 논문에서는 다중 뷰에서의 픽셀별 포토메트릭 오류 맵과 결합해 중요도 점수와 가지치기 점수를 계산하는 핵심 메트릭으로 활용된다. 이로 인해 단일 뷰 기반의 과적합을 줄이고 의미있는 원시요소만 유지할 수 있었다.
- Attribute-Conditioned SH Enhancement
- — Gaussian의 내재 속성(정규화된 위치, 스케일, 회전, 불투명도, 기초 SH)들을 입력으로 받는 경량 MLP를 통해 1차 SH 오프셋을 예측해 기초 표현을 보정하는 모듈이다. 보정된 오프셋은 추론 이전에 고정(baked)되므로 런타임 비용을 추가하지 않으면서도 압축으로 손실된 고주파 디테일을 복구한다. 초기 출력층을 0으로 초기화해 안정적 학습을 보장했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.