본문으로 건너뛰기

가려진 실내 장면을 편집 가능한 3D 객체로 복원하는 Lucida

Lucida는 다중 시점 증거로 완전한 3D 객체를 만들고 GizmoAct로 장면에 정렬합니다.

용어 해설

Scene Graph
객체를 노드로, 객체 사이의 지지·포함·인접 관계를 엣지로 저장하는 구조입니다. Lucida에서는 각 노드에 여러 시점의 이미지·마스크·부분 Point Cloud·대표 3D Box·참조 문구를 묶어 이후 3D Asset 생성과 배치의 입력으로 사용합니다.
Amodal Completion
가려진 부분까지 포함해 관측 대상의 완전한 형태와 외관을 복원하는 과정입니다. Lucida는 여러 시점의 RGB 관측을 선택해 가려지지 않은 객체 중심 이미지를 만든 뒤, 이를 Image-to-3D 모델에 입력해 독립적인 3D Asset으로 변환합니다.
9-DoF 자세(9-DoF Pose)
3차원 위치 3개, 회전 3개, 축별 크기 3개를 합친 객체 상태 표현입니다. Lucida의 GizmoAct는 생성된 Asset을 Point Cloud에 맞추면서 회전·이동·비등방성 스케일을 순차적으로 갱신해 총 9개 자유도를 조정합니다.
ADD-SB
예측된 자세의 표면과 정답 자세의 표면 사이 양방향 평균 최근접 거리를 미터 단위로 측정하는 지표입니다. [email protected]는 이 거리가 정답 객체 지름의 5%보다 작은 예측 비율로, 엄격한 표면 정렬 성공률을 나타냅니다.
F-Score
예측 표면과 정답 표면 사이의 정밀도와 재현율을 하나의 값으로 결합한 평가 지표입니다. 이 논문은 장면 수준에서 0.1m 거리 임계값을 사용해 누락되거나 잘못 배치된 표면이 얼마나 적은지 측정합니다.
GizmoAct
VLM이 3D 편집기의 객체 조작 인터페이스를 읽고 한 번에 하나의 실행 가능한 수정 명령을 내리는 정책입니다. 현재 렌더링 결과를 다시 입력으로 받아 회전·이동·스케일을 반복 수정하며, 정렬이 충분하면 stop을 스스로 선택합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 09. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.