TL;DR
온라인 환경에서 실시간으로 3D 장면 그래프를 만들려면 낮은 지연과 제한된 메모리 안에서 반복적인 다중 뷰 통합을 수행해야 한다. 기존 실시간 접근법은 객체를 단일 다변량 Gaussian으로 근사해 속도는 확보했지만 얇은 구조나 관측 변화에서 병합 실패로 그래프 구조가 파편화되는 문제가 발생했다. 본 논문은 고정 크기 입자 집합과 MMD 기반 분포 비교를 결합해 실시간 성능을 유지하면서 객체 병합과 관계 보존을 크게 개선했다.
왜 중요한가
온라인 환경에서 실시간으로 3D 장면 그래프를 만들려면 낮은 지연과 제한된 메모리 안에서 반복적인 다중 뷰 통합을 수행해야 한다. 기존 실시간 접근법은 객체를 단일 다변량 Gaussian으로 근사해 속도는 확보했지만 얇은 구조나 관측 변화에서 병합 실패로 그래프 구조가 파편화되는 문제가 발생했다. 본 논문은 고정 크기 입자 집합과 MMD 기반 분포 비교를 결합해 실시간 성능을 유지하면서 객체 병합과 관계 보존을 크게 개선했다.
핵심 기여
비모수 입자 기반 객체 표상 도입
각 객체를 고정 개수의 3D 입자 집합으로 표현해 단일 Gaussian이 강제하는 타원체 가정을 제거했다. 이미지 내 바운딩박스에서 픽셀을 샘플링해 깊이와 카메라 포즈로 후방투영한 점들을 입자로 저장하며 이 집합은 KDE로 해석되어 다중 모드와 얇은 구조를 보존한다. 고정 입자 수 유지로 메모리와 런타임 복잡도를 일정하게 관리했다.
분포 수준 병합 기준으로 MMD 적용
모멘트 수준의 Hellinger 거리가 애매한 경우에만 적용되는 2단계 연합 규칙에서 MMD를 사용해 두 객체의 KDE 사이 분포 차이를 직접 비교했다. MMD는 샘플 기반으로 계산되며 지지도 차이를 포착해 관점 변화나 부분 관측에도 더 안정적인 병합 신호를 제공한다. 문맥상 경계에 해당하는 쌍만 MMD로 판별해 계산비용을 제한했다.
KDE 재샘플링을 통한 일정 메모리 병합 업데이트
두 입자 집합을 합친 뒤 KDE에서 재샘플링해 다시 고정 크기 n의 입자 집합으로 만들며 이 과정으로 표현이 단일 모드로 수렴하거나 입자가 증식하는 문제를 방지했다. 재샘플링은 멀티뷰 기하학적 증거를 통합하면서 메모리 사용을 일정하게 유지할 수 있게 했다. 이 설계는 장기간 탐색 동안 표현 안정성에 기여했다.
MMD 기반 친화도 클러스터를 이용한 관계 전파
연결 정보가 누락된 경우를 보완하기 위해 병합 판정에서 계산된 MMD를 친화도 행렬로 전환해 유사한 객체 군집을 구성했다. 신규 노드의 관측된 2D 관계를 해당 군집 내로 전파하고 다수결로 최종 관계를 확정해 단일 뷰에서 누락된 에지 복원을 시도했다. 이 과정으로 관계 재현성과 그래프 완전도가 향상되었다.
핵심 아이디어 이해하기
온라인 3D 장면 그래프 생성은 연속적으로 들어오는 RGB-D 프레임을 제한된 시간과 메모리 안에서 합성해 객체와 관계를 유지해야 하는 문제다. 이전 실시간 접근법은 각 객체를 한 개의 다변량 Gaussian으로 근사해 빠른 통합을 실현했으나 얇거나 부분 관측된 구조에서는 공분산이 불안정해 잘못된 병합이나 과도한 분할이 누적되며 전역 그래프 품질이 저하되었다. 따라서 모멘트만 사용하는 비교 기준은 관점 변화와 불완전한 2D 예측 하에서 신뢰성에 한계가 있다.
이 논문의 출발점은 객체의 정밀한 기하학적 지지(support)를 보존하면서도 메모리와 연산을 일정하게 유지하는 표상을 찾는 것이다. 이를 위해 각 객체를 고정 개수의 3D 입자 샘플로 표현하고 이 입자 집합에 대해 RBF 커널 기반의 KDE를 구성했다. KDE에서 유래한 샘플 기반 통계량은 다중 모드를 허용하고 얇은 구조를 보존하므로 동일 객체의 부분 관측들이 서로 다른 공분산을 만드는 상황에서도 전체 지지 차이를 보존할 수 있다.
병합 판정은 계산 비용과 안정성의 균형을 고려해 설계됐다. 먼저 입자 집합에 대한 1·2차 모멘트로 Gaussian을 적합해 Hellinger 거리로 명확한 경우를 빠르게 처리하고, 값이 경계에 있을 때만 MMD로 KDE 간의 분포 차이를 직접 측정해 애매한 결정을 정교화한다. 병합 시에는 두 집합을 합쳐 KDE에서 재샘플링해 다시 고정 크기 입자를 유지하므로 장기 탐색에서 표현이 폭발하거나 단일 모드로 붕괴하는 것을 방지하고 일관된 그래프 구조를 확보할 수 있다.
관련 Figure

상단 행은 Gaussian 표상에서 로컬과 글로벌 객체가 분리되어 언더머징이 발생하는 사례를 보여주며 동일 객체가 두 개의 작은 가우시안으로 파편화되는 현상이 관찰된다. 하단 행은 NoPA의 KDE 기반 입자 표상이 로컬과 글로벌 관측을 하나의 통합된 분포로 병합해 보다 연속적인 공간적 지원을 보존함을 보여준다. 이 이미지는 논문의 핵심 주장인 비모수 표상이 병합 강건성과 기하학적 보존에 기여한다는 점을 직관적으로 보강한다.
Teaser Figure는 Gaussian 기반 표상(FROSS)과 NoPA의 비모수 입자 표상을 비교해 동일 객체의 병합 성공 여부와 공간적 커버리지를 시각화하고 있다.
방법론
파이프라인은 프레임별로 2D scene graph를 예측하고 각 2D 바운딩박스 내에서 픽셀을 균등 샘플링한 뒤 깊이와 카메라 포즈로 후방투영해 3D 입자 집합을 얻는 단계로 시작한다. 해당 입자 집합은 RBF 커널로 KDE를 구성하며 이 KDE는 객체의 공간적 지지와 다중 모드를 유지하는 근거 함수로 활용된다. 시스템은 글로벌 객체 집합을 유지하고 새로 들어온 로컬 후보에 대해 전역 객체들과의 연관을 온라인으로 결정해 전역 그래프를 순차적으로 갱신한다.
연관성 판정은 두 단계로 구성된다. 첫 단계는 각 입자 집합에 대해 평균과 공분산을 계산해 Gaussian으로 근사하고 Hellinger 거리 d_H를 계산해 δ_H±ε의 마진 밴드 밖에서는 즉시 병합 또는 신생(spawn)을 결정한다. 두 단계는 경계 밴드에 남은 쌍에 한해 MMD를 계산해 d_MMD ≤ δ_MMD이면 병합, 아니면 신생으로 결정한다. 이 구조는 대부분의 케이스를 저비용 모멘트 비교로 처리하고 난해한 케이스만 샘플 기반 분포 비교로 풀어 계산을 집중시키는 방식이다.
병합 업데이트는 합집합 입자에 대해 KDE를 재적용한 다음 고정 개수 n으로 재샘플링해 전역 객체의 입자 집합을 대체한다. 이 과정은 입자 수가 시간에 따라 증가하지 않도록 보장하고 통합된 공간적 증거를 보존한다. 관계 전파는 연관성 판정에서 얻은 MMD 값을 친화도 행렬로 변환해 유사 객체 군집을 구성하고, 신규 노드의 2D 관측 관계를 군집 내에 전파한 뒤 다수결로 최종 관계를 확정해 단일 뷰에서 누락된 에지를 회복한다.
관련 Figure

다이어그램은 각 단계의 입력과 출력 형태를 명확히 표시해 시스템 흐름을 수치적으로 재현할 수 있게 설계되어 있다. 특히 2단계 연합 규칙(헬링거 전처리 후 MMD 적용)과 고정 입자 수 유지 위해 KDE에서 재샘플링하는 흐름이 포함되어 계산 비용 제어와 표현 보존 원리를 시각적으로 전달한다. 이 그림은 방법론 섹션의 절차적 설명을 보완하는 핵심 참조 자료다.
프레임워크 다이어그램은 프레임 입력부터 2D SSG 추출, 3D 입자 리프팅, 온라인 연관 및 병합, 관계 전파로 이어지는 전체 파이프라인 단계를 순차적으로 보여준다.

이미지는 Stage 1에서 평균·공분산 근사로 빠르게 결정하고 Stage 2에서 MMD로 분포 수준 유사도를 계산하는 세부적 흐름을 보여준다. 또한 병합 후 KDE 재샘플링으로 고정 크기 입자 집합을 얻는 과정이 제시되어 메모리 제약을 만족시키는 방법론적 핵심을 강조한다. 이 도면은 알고리즘 구현 시 연산 절차와 조건 분기를 파악하는 데 유용하다.
병합 과정 도식은 입자 집합에 KDE를 적용한 뒤 Hellinger로 선별하고 MMD로 애매한 쌍을 판단해 병합 또는 신생을 결정하는 2단계 절차를 시각화하고 있다.
주요 결과
3DSSG 벤치마크에서 NoPA는 n=256 설정으로 관계(relationship) recall 53.2%와 객체(object) recall 69.0%를 달성해 기존 온라인 방법들보다 큰 폭의 향상을 보였다. ReplicaSSG에서도 n=256 설정으로 관계 recall 36.9%를 기록하며 FROSS 대비 전반적 성능 우위를 확인했다. 이 수치들은 비모수 입자 표상과 MMD 기반 병합이 관측 변화와 얇은 구조에 대해 병합 신뢰도를 개선했음을 의미한다.
제곱형 표본·절단 등 세부 평가에서 두 단계 연합 규칙과 관계 전파가 중요한 역할을 했다. 구성요소 제거 실험에서 입자 표상만 적용하면 객체 recall은 개선되나 관계·predicate 성능이 떨어졌고, MMD 병합과 관계 전파를 통합하면 세 가지 지표 모두에서 최종 성능이 상승했다. MMD 임계값 δ_MMD를 낮추면 객체 recall이 증가하고 관계 recall이 감소하는 전형적인 정밀도-재현율 트레이드오프가 관찰되어 병합 임계값 설정이 실무적 튜닝 포인트임이 확인됐다.
실시간성 관점에서 NoPA는 n=256 기준으로 평균 지연이 약 27 ms 수준으로 보고되어 기존 실시간 기법과 동등한 범주의 레이턴시를 유지하면서도 VRAM 사용량은 유사한 수준을 보였다. 이 결과는 분포 수준 판정이 전 프레임에 대해 과도한 계산 부담을 발생시키지 않도록 설계된 덕분이다.
관련 Figure

그림은 비모수 입자 표상이 부분 관측으로 인한 분할 현상을 줄이고 얇은 구조를 포함한 전체 객체 지지(support)를 더 잘 보존한다는 주장을 시각적으로 뒷받침한다. FROSS에서 보이는 스트리키 아티팩트는 Gaussian 근사의 부적합성에서 기인하며 NoPA는 다중 모드를 허용해 이러한 아티팩트를 완화한다. 이 정성 결과는 정량적 벤치마크에서의 성능 향상과 상호 보완적이다.
정성적 비교 이미지로서 FROSS의 Gaussian 시각화가 객체의 일부분만 포착하거나 장면 전반에 스트리키한 아티팩트를 남기는 반면 NoPA의 KDE 시각화는 객체의 전체 공간 범위를 더 잘 유지하는 장면을 보여준다.

GT(ground truth)와 비교하면 FROSS는 누락된 노드 및 잘못된 엣지 사례가 많이 보이며 NoPA는 더 많은 올바른 예측을 생성해 그래프 일관성을 높였다. 이 시각화는 관계 전파와 비모수 병합이 관계 복원에 기여했음을 직관적으로 보조하고 벤치마크 정량 결과와 일치한다. 해당 그림은 결과 섹션의 정성적 비교를 보강하는 역할을 한다.
정성적 성능 비교로서 GT, FROSS, NoPA의 예측 그래프를 나란히 제시해 NoPA가 누락된 노드와 잘못된 간선 수를 줄이고 올바른 노드·간선을 더 많이 복원한 사례를 보여준다.
기술 상세
전체 아키텍처는 프레임별 2D SSG 예측기(RT-DETR-EGTR)를 전처리기로 사용하고 각 2D 바운딩박스 내 픽셀을 n개 샘플해 깊이 맵과 카메라 pose로 후방투영해 3D 입자를 얻는 구성이다. 각 입자 집합은 RBF 커널 κ(x,y)=exp(-||x-y||^2/(2σ^2))로 KDE를 형성하며 σ는 입자 합집합의 쌍별 거리에 대한 median heuristic으로 설정된다. 이 KDE는 병합 시의 분포 비교와 재샘플링의 기반이 된다.
온라인 연관성 판정은 두 단계로 작동한다. 첫째로 각 입자 집합에 대해 평균 μ와 공분산 Σ를 추정해 Gaussian으로 근사하고 Bhattacharyya 기반의 Hellinger 거리 d_H를 계산해 경계 밖이면 즉시 병합 또는 spawn 결정을 내린다. 입력 값이 [δ_H-ε, δ_H+ε] 구간에 있는 쌍만 Stage 2로 넘어가며 이때 MMD를 샘플 기반으로 계산해 d_MMD≤δ_MMD이면 병합으로 판정한다.
MMD 계산은 세 항의 기대값으로 구성되며 실제 구현에서는 샘플 평균으로 근사한다. 구체적으로 d_MMD^2 = E_{x,x'∼X}[κ(x,x')] + E_{y,y'∼Y}[κ(y,y')] - 2E_{x∼X,y∼Y}[κ(x,y)]이며 샘플 수는 입자 수 n에 비례한다. 병합 시에는 X∪Y에 대해 KDE를 다시 구하고 그 KDE에서 n개의 입자를 재샘플링해 전역 객체의 입자 집합을 교체한다. 이 재샘플링은 표현이 시간에 따라 증식하지 않도록 보장한다.
관계 전파는 병합 판정에서 얻는 MMD 기반 친화도를 이용해 affinity matrix를 구성하고 군집화를 수행해 같은 군집 내에서 2D로 관측된 관계를 복사·다수결로 확정한다. 이러한 다수결 기반 집계는 단일 관측의 노이즈로 인한 관계 누락을 줄이며 그래프 전역 일관성을 높인다. 구현상 중요한 하이퍼파라미터로는 입자 수 n(논문에서 n=256 사용), δ_MMD(3DSSG에 0.7, ReplicaSSG에 0.6로 보고), 및 ε=0.05의 마진 폭이 있다.
한계점
본 방법은 로컬 2D SSG 예측의 품질에 크게 의존하며 2D 예측이 부정확하면 입자 기반 표상과 MMD 병합도 상한 성능을 갖는다. 깊이 맵 및 카메라 pose 추정의 노이즈는 입자 샘플 품질을 떨어뜨려 병합 오류를 유발할 수 있으며 그러한 경우 성능이 저하된다. 논문은 이러한 한계를 명시적으로 언급하며 2D 예측과 센서 입력의 품질이 최종 결과의 상한을 결정한다고 보고했다.
실무 활용
NoPA는 실시간 제약이 있는 로봇 탐색, 자율 이동체의 장면 이해, 그리고 증강 현실에서 연속적 장면 통합을 필요로 하는 응용에 적합하다. 고정 메모리 입자 표상과 경계 기반 MMD 적용은 제한된 하드웨어 자원에서도 비교적 안정적인 합성이 가능하게 한다. 관계 전파는 단일 뷰에서 누락된 관계를 회복하는 데 유용하므로 다중 뷰 기반 응용에서 그래프 완전도를 높인다.
- 로봇 탐색 중 실시간 장면 그래프 생성으로 경로 계획 및 객체 상호작용을 보조하는 시스템 통합
- 증강 현실에서 연속 촬영으로 얻은 환경 정보를 가볍게 통합해 객체 위치와 상호관계를 유지하는 렌더링 파이프라인
- 제한된 엣지 디바이스에서 실시간 객체 병합과 관계 예측을 수행해 원격 모니터링용 장면 이해를 제공하는 애플리케이션
코드 공개 여부: 비공개
키워드
용어 해설
- Kernel Density Estimate (KDE)
- — 입자 집합을 연속 확률밀도로 근사하기 위해 RBF 같은 커널을 각 입자에 적용하고 평균을 취하는 비모수적 방법이다. 논문에서는 객체 입자 집합에 대해 KDE를 계산해 객체의 3D 점지원을 표현하고 병합 시 분포를 비교하는 근거로 사용한다. KDE는 복수 모드를 보존하므로 얇은 구조나 부분 관측 상황에서 Gaussian 평균화보다 공간 확장을 잘 유지한다.
- Maximum Mean Discrepancy (MMD)
- — 두 확률분포의 차이를 reproducing kernel Hilbert space에서의 평균 차이로 측정하는 비모수 거리다. 논문에서는 두 객체의 KDE로부터 샘플 기반의 MMD를 계산해 분포 레벨 유사도를 판정하고 애매한 병합 판정을 안정적으로 처리한다. MMD는 1차·2차 모멘트가 유사한 경우에도 지지(support) 차이를 포착할 수 있어 관측 변화에 강하다.
- Non-Parametric Particle Set
- — 각 객체를 고정 크기 n개의 3D 입자 샘플로 표현하는 비모수 표상으로, 각 입자는 카메라 깊이 맵과 pose로 후방투영된 3D 포인트다. 논문에서는 입자 집합을 KDE로 해석하고 병합 시 두 집합을 합쳐 KDE에서 재샘플링해 고정 메모리를 유지한다. 이 표상은 단일 Gaussian으로는 잃어버리는 얇은 구조나 다중 모드를 보존한다.
- Hellinger Distance
- — 두 다변량 Gaussian 근사 사이의 유사도를 빠르게 측정하기 위한 모멘트 수준의 거리로서 논문에서는 상시 계산 비용을 낮추는 사전 필터로 사용한다. 입자 집합에 대해 평균·공분산으로 Gaussian을 적합한 뒤 Hellinger 거리를 계산해 명확한 병합/비병합을 빠르게 결정한다. 이 필터는 연산이 상수 시간이며 애매한 쌍만 MMD로 넘겨 비용을 제어한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.