TL;DR
게시자는 컵과 공 게임을 수행하는 VLM 데모에서 VLM이 긴 장면 정보를 직접 처리하는 방식이 적합하지 않을 수 있다는 점을 반영해 구조를 바꿨습니다. 개선 버전에서는 VLM의 역할을 segmentation model에 전달할 프롬프트 생성으로 제한하고, 실제 시각 분할은 SAM 2.1 Tiny가 맡습니다. SAM 2.1 Tiny는 더 빠르게 실행되지만 open-vocabulary가 아니라는 제약이 있으며, SAM 3를 사용한다면 Qwen의 프롬프트 생성이 필요하지 않을 수 있다고 설명합니다. 이 구성은 VLM을 상위 조정자로 두고 작업별 모델을 연결하는 방식으로 확장할 수 있다는 방향을 보여줍니다.
실용적 조언
- VLM에 장면 이해와 픽셀 단위 분할을 모두 맡기기보다 프롬프트 생성과 segmentation을 분리하면 각 모델의 역할과 병목을 따로 조정할 수 있습니다.
- 빠른 실행이 우선이면 SAM 2.1 Tiny를 고려할 수 있지만, 이름이 정해지지 않은 대상을 다뤄야 한다면 open-vocabulary 지원 여부를 먼저 확인해야 합니다.
섹션별 상세
이미지 분석

이미지는 VLM이 선택하거나 지시한 대상을 segmentation model이 게임 화면에서 찾아 표시하는 결과를 담고 있습니다. 화면 하단의 "Pick 3 characters to hide." 지시와 특정 캐릭터의 경계 상자는 언어적 프롬프트와 시각적 대상 분할이 결합된 데모 구조를 뒷받침합니다.
컵 게임 화면에서 여러 캐릭터가 배치되어 있고, 오른쪽 캐릭터에는 이름표와 초록색 경계 상자가 표시되어 있습니다.
용어 해설
- 비전 언어 모델(VLM)
- — 이미지와 텍스트를 함께 입력받아 장면을 해석하고 언어로 지시를 생성하는 모델입니다. 이 게시물에서는 VLM이 게임 속 대상을 직접 처리하기보다, segmentation model에 전달할 프롬프트를 만드는 상위 조정자 역할을 맡습니다. 긴 장면의 상태를 계속 유지해야 하는 작업에서는 context window가 제약으로 작용할 수 있습니다.
- 세그멘테이션 모델(Segmentation Model)
- — 이미지 안에서 지정된 대상의 픽셀 영역이나 위치를 분리하는 모델입니다. 이 데모에서는 VLM이 만든 지시를 입력으로 받아 게임 화면 속 캐릭터를 찾아 표시합니다. 언어적 판단과 시각적 분할을 분리해 VLM의 역할과 전문 모델의 역할을 나눈 구조입니다.
- 컨텍스트 윈도(Context Window)
- — 모델이 한 번에 유지하고 처리할 수 있는 입력 정보의 범위입니다. 컵과 공 게임처럼 화면 변화와 이전 상태를 계속 추적하는 작업에서는 이 범위가 제한되면 VLM을 직접 사용하는 방식의 적합성이 낮아질 수 있습니다. 게시자는 이 문제를 전문 모델을 붙이는 방식으로 우회했습니다.
- 오픈 보캐뷸러리(Open-Vocabulary)
- — 미리 정해진 클래스 목록에 한정되지 않고 다양한 이름이나 개념의 대상을 인식하는 능력입니다. 게시자는 SAM 2.1 Tiny가 빠른 대신 open-vocabulary가 아니라는 점을 단점으로 제시합니다. 따라서 처리 속도와 대상 범용성 사이에 선택이 필요합니다.
- 모델 조합(Model Composition)
- — 하나의 거대 모델이 모든 작업을 수행하도록 하지 않고, 역할별 전문 모델을 연결하는 설계 방식입니다. 이 사례에서는 VLM이 프롬프트를 만들고 segmentation model이 화면 속 캐릭터를 분리합니다. 상위 모델을 두뇌처럼 사용하면서 하위 모델의 속도와 특화 기능을 활용하는 구조입니다.
언급된 도구
segmentation model에 전달할 프롬프트를 생성하는 VLM 역할
VLM의 프롬프트를 받아 게임 화면 속 캐릭터를 분할하는 모델
별도 VLM 프롬프트 없이 사용할 수 있는 대안으로 게시물에서 가정된 segmentation model
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.