본문으로 건너뛰기

VLM과 SAM 2.1 Tiny를 결합한 컵 게임

VLM은 프롬프트를 만들고 SAM 2.1 Tiny는 게임 화면의 캐릭터를 분할한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

게시자는 컵과 공 게임을 수행하는 VLM 데모에서 VLM이 긴 장면 정보를 직접 처리하는 방식이 적합하지 않을 수 있다는 점을 반영해 구조를 바꿨습니다. 개선 버전에서는 VLM의 역할을 segmentation model에 전달할 프롬프트 생성으로 제한하고, 실제 시각 분할은 SAM 2.1 Tiny가 맡습니다. SAM 2.1 Tiny는 더 빠르게 실행되지만 open-vocabulary가 아니라는 제약이 있으며, SAM 3를 사용한다면 Qwen의 프롬프트 생성이 필요하지 않을 수 있다고 설명합니다. 이 구성은 VLM을 상위 조정자로 두고 작업별 모델을 연결하는 방식으로 확장할 수 있다는 방향을 보여줍니다.

실용적 조언

  • VLM에 장면 이해와 픽셀 단위 분할을 모두 맡기기보다 프롬프트 생성과 segmentation을 분리하면 각 모델의 역할과 병목을 따로 조정할 수 있습니다.
  • 빠른 실행이 우선이면 SAM 2.1 Tiny를 고려할 수 있지만, 이름이 정해지지 않은 대상을 다뤄야 한다면 open-vocabulary 지원 여부를 먼저 확인해야 합니다.

섹션별 상세

01
게시자는 컵과 공 게임에서 VLM이 화면 속 대상과 이전 상태를 계속 추적하도록 만드는 방식이 context window 제약과 맞지 않을 수 있다고 판단했습니다. 그래서 VLM이 게임의 모든 시각 처리를 직접 수행하지 않고 segmentation model에 전달할 프롬프트만 생성하도록 역할을 축소했습니다. 입력 장면의 의미적 판단은 VLM에, 대상의 위치와 영역 분리는 전문 모델에 맡기는 분업 구조입니다.
02
개선된 데모에서는 Qwen이 어떤 대상을 처리할지 지시하고 SAM 2.1 Tiny가 게임 화면에서 해당 캐릭터를 찾아 분할합니다. 게시자는 SAM 2.1 Tiny를 선택한 이유로 더 빠른 실행 속도를 들었지만, open-vocabulary가 아니라는 단점을 함께 제시했습니다. 이미지에는 게임 화면과 함께 선택된 캐릭터의 초록색 경계 상자와 이름이 표시되어 이 연결 구조의 결과가 드러납니다.
03
게시자는 SAM 3를 실행한다면 자체적으로 프롬프트를 처리할 수 있어 Qwen을 별도로 사용하지 않아도 될 것이라고 말합니다. 반대로 SAM 2.1 Tiny를 선택한 현재 구성에서는 VLM이 전문 시각 모델을 구동하기 위한 언어 인터페이스 역할을 맡습니다. 이 사례의 핵심은 VLM 하나에 모든 작업을 몰아주기보다 속도와 기능이 다른 task-specific model을 조합하는 데 있습니다.

이미지 분석

컵 게임 화면에서 여러 캐릭터가 배치되어 있고, 오른쪽 캐릭터에는 이름표와 초록색 경계 상자가 표시되어 있습니다.
Screenshot

이미지는 VLM이 선택하거나 지시한 대상을 segmentation model이 게임 화면에서 찾아 표시하는 결과를 담고 있습니다. 화면 하단의 "Pick 3 characters to hide." 지시와 특정 캐릭터의 경계 상자는 언어적 프롬프트와 시각적 대상 분할이 결합된 데모 구조를 뒷받침합니다.

컵 게임 화면에서 여러 캐릭터가 배치되어 있고, 오른쪽 캐릭터에는 이름표와 초록색 경계 상자가 표시되어 있습니다.

용어 해설

비전 언어 모델(VLM)
이미지와 텍스트를 함께 입력받아 장면을 해석하고 언어로 지시를 생성하는 모델입니다. 이 게시물에서는 VLM이 게임 속 대상을 직접 처리하기보다, segmentation model에 전달할 프롬프트를 만드는 상위 조정자 역할을 맡습니다. 긴 장면의 상태를 계속 유지해야 하는 작업에서는 context window가 제약으로 작용할 수 있습니다.
세그멘테이션 모델(Segmentation Model)
이미지 안에서 지정된 대상의 픽셀 영역이나 위치를 분리하는 모델입니다. 이 데모에서는 VLM이 만든 지시를 입력으로 받아 게임 화면 속 캐릭터를 찾아 표시합니다. 언어적 판단과 시각적 분할을 분리해 VLM의 역할과 전문 모델의 역할을 나눈 구조입니다.
컨텍스트 윈도(Context Window)
모델이 한 번에 유지하고 처리할 수 있는 입력 정보의 범위입니다. 컵과 공 게임처럼 화면 변화와 이전 상태를 계속 추적하는 작업에서는 이 범위가 제한되면 VLM을 직접 사용하는 방식의 적합성이 낮아질 수 있습니다. 게시자는 이 문제를 전문 모델을 붙이는 방식으로 우회했습니다.
오픈 보캐뷸러리(Open-Vocabulary)
미리 정해진 클래스 목록에 한정되지 않고 다양한 이름이나 개념의 대상을 인식하는 능력입니다. 게시자는 SAM 2.1 Tiny가 빠른 대신 open-vocabulary가 아니라는 점을 단점으로 제시합니다. 따라서 처리 속도와 대상 범용성 사이에 선택이 필요합니다.
모델 조합(Model Composition)
하나의 거대 모델이 모든 작업을 수행하도록 하지 않고, 역할별 전문 모델을 연결하는 설계 방식입니다. 이 사례에서는 VLM이 프롬프트를 만들고 segmentation model이 화면 속 캐릭터를 분리합니다. 상위 모델을 두뇌처럼 사용하면서 하위 모델의 속도와 특화 기능을 활용하는 구조입니다.

언급된 도구

Qwen중립

segmentation model에 전달할 프롬프트를 생성하는 VLM 역할

SAM 2.1 Tiny중립

VLM의 프롬프트를 받아 게임 화면 속 캐릭터를 분할하는 모델

SAM 3중립

별도 VLM 프롬프트 없이 사용할 수 있는 대안으로 게시물에서 가정된 segmentation model

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.