왜 중요한가
로봇이 언어 지시와 RGB-D 관측에서 3D 엔드 effector 경로를 계획할 때, monocular SAM3D 재구성이 포즈 불확실성과 비가시 영역으로 인해 왜곡될 수 있다. 또한 과거 경험의 재사용이 무작정 추가되는 append-only 메모리로는 현재 장면과 기하적 적용 가능성의 불일치를 해결하기 어렵다. GeoFuse-MV3D는 다중 뷰 기하 priors의 신뢰성 확인 및 축별 보정을 통해 고정된 입력 뷰에서만 기하 정보를 강화하고, KnowledgeBank는 품질·신뢰도·수명주기·충돌 정보를 갖춘 거버넌스 메모리로 재사용 품질을 제어한다. 이 둘의 결합은 재구성 정확도와 장기 계획의 신뢰성을 동시에 개선한다.
핵심 기여
GeoFuse-MV3D 재구성 브랜치
다중 뷰 입력이 있을 때 MV-SAM3D 재구성에 기하 priors를 보조로 활용하되, 외부 기하 priors를 오직 기하 정보(prior)로 취급하고 색상/질감 정보는 손대지 않는 geometry-only fusion을 유지한다. 마스크 일치성(s(p))를 이용해 소량의 축소 보정(p')를 수행하고, 축 보정(a, δ)으로 정교하게 정렬하며, p_out = (1-α)x_A + αx_B로 기하 좌표를 안정적으로 융합한다.
Governed KnowledgeBank 도입
KnowledgeBank를 거버넌스(long-term memory) 시스템으로 업그레이드하여 quality, confidence, lifecycle, verifier, conflict 등을 메타데이터로 저장하고, retrieval를 precision-oriented하게 수행한다. 메모리 항목은 q, c, y, z, κ, R, L, v로 표현되며 admission, merge, replace, discard, summarization, archival의 정책으로 관리된다.
3DAgent와의 통합 강화
개체 중심 기하 증거와 governed KnowledgeBank를 기반으로 3DAgent가 중간 계획 컨텍스트를 구성하도록 하여, 다단계 end-effector 경로를 보다 안정적으로 계획하고 저수준 제어로 전달한다.
훈련 없이 로봇 계획에서의 실용성 입증
RLBench 14개 태스크에서 훈련 없이 GeneralVLA-2의 경로 계획 성능을 확인하고, Real-world 실험에서 four tasks를 수행해 CAP 및 RoboPoint 대비 향상된 성공률을 보인다.
핵심 아이디어 이해하기
단계 1: 개체 중심의 3D 증거를 RGB-D 다중 뷰에서 생성한다. 다중 뷰가 있을 경우 GeoFuse-MV3D가 geometry-prior를 입력 뷰 마스크와 대조해 보정하고, soft visual hull과 axis-wise refinement를 적용해 기하만 융합한다. 단 step 2: 기존 KnowledgeBank를 거버너블 메모리로 확장하고, memory 품질과 충돌 정보를 메타데이터로 관리한 뒤, 정밀 검색으로 planning context를 구성한다. 단계 3: 3DAgent는 refined geometry와 structured KnowledgeBank를 바탕으로 3D 엔드-퍼렉스 경로를 산출하고, 로봇 제어 모듈로 전달한다.
방법론
- GeoFuse-MV3D 구성: 입력 뷰 I_i, 마스크 M_i, 카메라 내부 K_i, 포즈 T_i로 구성된 다중 뷰 데이터 D를 사용한다. MV-SAM3D의 초기 Gaussian 오브젝트 G_0에서 Source A를 기하 priors로 사용하고, Source B(provider-free axis compensation)와의 축 보정 및 소프트 비주얼 헐을 적용해 p_out을 얻는다. 계산 흐름: s(p) = (1/ max(|V(p)|,1)) ∑_{i∈V(p)} M_i(π_i(p)); p' = c + (p - c)(1 - λ(p)); p'' = c + (p' - c) ⊙ a + δ; p_out = (1-α) x_A + α x_B; x_out^j = x_A^j + α w^j (x_B^j - x_A^j) with w^j = clip(s(x_A^j)/s(x_B^j), 0,1). 2) Governed KnowledgeBank: m = (q, c, y, z, κ, R, L, v); ϕ를 통해 점수 토큰을 매핑하고 S(q_t, X_t, m) = r_text(q_t, m) + κ_m + b_success(m) + b_recency(m) + b_usage(m) - p_conflict(m) - p_stale(m); 입장/합병/대체/폐기/요약/보관으로 관리한다. 3) 3DAgent 통합: ASM, 3D 포인트 구성, KnowledgeBank 컨텍스트를 받아 경로 τ_t를 산출하고, 로우-레벨 제어로 전달한다. 4) 학습 필요 없음: 파이프라인은 훈련 없이 런타임에서 재사용 가능한 지식을 활용한다.
관련 Figure

다중 뷰 입력에서 기하 priors를 보조로 사용하고, mask-검증 및 축 보정을 통해 기하를 점진적으로 개선하는 과정을 도식화한다.
GeoFuse-MV3D 재구성 흐름의 개요 다이어그램

소스A( priors )와 SourceB( provider-free axis compensation )의 보정 정보를 mask와 함께 비교-융합하는 구조를 시각화한다.
GeFuse-MV3D의 외부 기하 priors 처리 및 axis-wise 보정 구조

다중 뷰 기반 재구성 및 KnowledgeBank를 활용한 플래너 인터페이스의 전체 흐름을 보여준다.
GeneralVLA-2 로봇 계획 파이프라인의 실험 구성 예시
주요 결과
5.1 GeoFuse-MV3D 평가(GSO-30): CD는 MV-SAM3D 대비 2.20% 감소, LPIPS은 2.02% 감소, PSNR은 2.36% 증가, SSIM은 1.03% 증가. 5.2 KnowledgeBank 평가: Terminal-Bench SR은 ReasoningBank 대비 4.53% 증가, SWE-Bench Verified의 Resolve Rate은 3.73% 증가하며 AS는 각각 4.95%, 5.65% 감소. 5.3 RLBench 평가(훈련 없이 14개 태스크): GeneralVLA-2가 다수의 태스크에서 우수한 경로를 생성하고, KnowledgeBank의 도입으로 일관된 개선이 관찰된다. 5.4 실세계 로봇 실험: four 작업에서 training-free 성공률이 63.33, 40.00, 53.33, 83.33으로 나타났다. Appendix의 부가 분석에서 구성요소의 기하 priors·마스크 검증·제한적 fusion의 기여가 확인된다.
관련 Figure

다양한 구성 요소(A: 기하 prior+앱 공정, A+SoftVH, B: axis compensation, A+B)별 CD/PSNR/SSIM/LPIPS의 변화를 시각화한다.
GeoFuse-MV3D 컴포넌트 ablation 개요
기술 상세
아키텍처: GeoFuse-MV3D 재구성 파이프라인과 governed KnowledgeBank를 로봇 계획 스택의 planner-facing 인터페이스에 결합한다. 수식/알고리즘 핵심: (i) s(p)로 입력 뷰에서의 마스크 일치성 계산, (ii) p' 및 p''를 이용한 축 방향 보정, (iii) p_out 및 x_out 이어지는 합성으로 기하 정보만 융합, (iv) KnowledgeBank의 m 구조와 S(q_t, X_t, m) 함수로 메모리 선택을 제어, (v) admission/merge/discard 등의 라이프사이클로 관리. 차별점: prior 기반 재구성의 보수적 융합, provider-free axis compensation, 컨피덴스 기반 가중합으로 기하 정보의 신뢰성을 보장. 학습 세부사항: 학습 없이 런타임에 의존하는 평가 프레임워크. 구현 세부: 5-뷰 입력과 MV-SAM3D의 동일 입력 프로토콜을 유지하면서 GeoFuse-MV3D를 추가. 메모리 모듈: m = (q,c,y,z,κ,R,ℒ,v) 형태의 레코드, 리뷰 및 정합성 체크를 통한 품질 평가, 그리고 활성/요약/보관의 라이프사이클 관리. 평가 대상 데이터셋: GSO-30, Terminal-Bench 2.0, SWE-Bench Verified, RLBench 시뮬레이션, 실제 로봇 실험.
한계점
입력 관찰·마스크·포즈의 신뢰성에 의존하며, 다중 뷰 보정에서도 보정 실패가 재구성에 영향을 줄 수 있다. 거버넌스 메모리는 verifier의 신뢰도에 좌우되며, 메모리의 충돌/상태 관리 실패 시 성능 저하 가능성이 있다. 실제 실험은 단거리의 정적 물체 및 표면에 한정되며, 장거리 이동 로봇, 강한 Occlusion, Deformable Object, 사람-로봇 협업 시나리오에 대한 확장은 필요하다.
실무 활용
로봇 계획 파이프라인에서 기하 신뢰도와 장기 메모리의 품질 관리가 실제 성능을 크게 좌우함을 보여준다. GeoFuse-MV3D는 다중 뷰에서의 기하 정보를 보다 안정적으로 반영하며, governed KnowledgeBank는 기억의 질과 적용성을 보장한다.
- 로봇 팔의 물체 조작 경로 계획 개선
- 다중 뷰 기반 물체 재구성에서의 포즈 안정성 강화
- 장기 기억 기반 계획의 재현성 및 안전성 향상
- 실세계 로봇 실험에서의 학습 없이 실용적 로봇 수행
코드 공개 여부: 공개
코드 저장소 보기관련 Figure

메모리의 질/신뢰도/수명주기/충돌 등 메타데이터를 포함한 거버넌스 흐름 및 검색 컨텍스트 구성 원리를 설명한다.
Governed KnowledgeBank 아키텍처 개요

제시된 실제 로봇 시연 프레임으로, 모델의 일반화 가능성을 시각적으로 보강한다.
실세계 로봇 실행 예시 스크린샷
키워드
용어 해설
- 기하_prior(geometry-prior)
- — 다양한 입력 뷰에서 얻은 기하 정보(예: 포인트 구획)와 외부 기하 예측치를 사전에 제공하는 정보를 말하며, 재구성 과정에서 이를 보조 피드로 활용한다.
- 소프트 비주얼 헐(soft visual hull)
- — 입력 뷰의 마스크와 기하 priors를 이용해 부드럽게 정의된 3D 형상 경계(visual hull)를 생성하고, 모호한 영역의 기하 보정을 허용한다.
- 마스크 일치성(mask-consistency)
- — 다중 뷰에서의 마스크 정보가 서로 일치하는 정도를 점수화하여 기하 수정의 신뢰도를 판단한다.
- 축 방향 보정(axis-wise refinement)
- — XYZ 축별로 기하를 미세하게 보정하는 방법으로, 마스크-투사와 뷰 간 정합성을 높인다.
- MV-SAM3D
- — 다중 뷰 입력에 기반한 3D 재구성 기법의 한 축으로, 본 논문에서 기하 priors를 보완하는 재구성 모듈로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.