본문으로 건너뛰기

SpatialBlock-15k로 LVLMs 공간 지능 강화

15,000개 합성 블록 쌓기 문제로 LVLMs의 3D 구조·시점 변환·구조 결합 추론을 학습시켜 실제 장면 벤치마크 성능을 높였습니다.

용어 해설

대형 비전-언어 모델(Large Vision-Language Model)
이미지와 텍스트를 함께 입력받아 시각적 내용을 이해하고 언어로 답하는 모델입니다. 이 논문에서는 2D 이미지에서 가려진 블록과 3D 구조를 추론하는 공간 지능 학습의 대상입니다.
공간 지능(Spatial Intelligence)
2D 이미지에 나타난 정보를 바탕으로 물체의 3D 구조, 위치, 방향과 변환 결과를 추론하는 능력입니다. 자율주행이나 Robotics처럼 장면의 기하 관계를 이해해야 하는 작업에 중요합니다.
앵커 기반 추론(Anchor-based Reasoning)
복잡한 장면에서 특정 물체나 블록을 기준점으로 선택한 뒤 다른 요소의 위치와 관계를 기준점에 상대적으로 계산하는 방식입니다. SpatialBlock-15k에서는 색으로 앵커와 대응 블록을 표시합니다.
그룹 상대 정책 최적화(Group Relative Policy Optimization (GRPO))
한 질문에 대해 여러 응답을 생성하고 각 응답의 보상을 같은 그룹의 평균·표준편차와 비교해 정책을 갱신하는 강화학습 방식입니다. 이 논문에서는 정답, 추론 형식, 응답 길이를 보상에 반영합니다.
저순위 적응(Low-Rank Adaptation (LoRA))
기존 모델의 전체 가중치를 직접 갱신하지 않고 저순위 분해 행렬을 추가로 학습하는 Fine-tuning 방식입니다. 논문에서는 기본 공간 능력과 기존 Chain-of-Thought 능력을 함께 보존하기 위한 초기화에 사용합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 07.수집 2026. 09. 12.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.