용어 해설
- 대형 비전-언어 모델(Large Vision-Language Model)
- — 이미지와 텍스트를 함께 입력받아 시각적 내용을 이해하고 언어로 답하는 모델입니다. 이 논문에서는 2D 이미지에서 가려진 블록과 3D 구조를 추론하는 공간 지능 학습의 대상입니다.
- 공간 지능(Spatial Intelligence)
- — 2D 이미지에 나타난 정보를 바탕으로 물체의 3D 구조, 위치, 방향과 변환 결과를 추론하는 능력입니다. 자율주행이나 Robotics처럼 장면의 기하 관계를 이해해야 하는 작업에 중요합니다.
- 앵커 기반 추론(Anchor-based Reasoning)
- — 복잡한 장면에서 특정 물체나 블록을 기준점으로 선택한 뒤 다른 요소의 위치와 관계를 기준점에 상대적으로 계산하는 방식입니다. SpatialBlock-15k에서는 색으로 앵커와 대응 블록을 표시합니다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization (GRPO))
- — 한 질문에 대해 여러 응답을 생성하고 각 응답의 보상을 같은 그룹의 평균·표준편차와 비교해 정책을 갱신하는 강화학습 방식입니다. 이 논문에서는 정답, 추론 형식, 응답 길이를 보상에 반영합니다.
- 저순위 적응(Low-Rank Adaptation (LoRA))
- — 기존 모델의 전체 가중치를 직접 갱신하지 않고 저순위 분해 행렬을 추가로 학습하는 Fine-tuning 방식입니다. 논문에서는 기본 공간 능력과 기존 Chain-of-Thought 능력을 함께 보존하기 위한 초기화에 사용합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



