본문으로 건너뛰기

VLMs를 활용한 비전-언어 파이프라인 구축 가이드

Roboflow Workflows를 통해 오픈소스 및 상용 VLM을 통합하여 이미지 캡셔닝 및 자동 파일명 생성과 같은 지능형 비전 파이프라인을 구축하는 방법을 제시한다.

섹션별 상세

01
VLMs는 Gemini 3, GPT-5와 같은 상용 모델과 Qwen 3, LLaMA 3와 같은 오픈소스 모델을 포함하며 시각적 인식과 언어 추론을 결합한다. 이러한 모델들은 이미지 캡셔닝, 시각적 질의응답(VQA), OCR 기반 추론 등 다양한 컴퓨터 비전 작업을 단일 워크플로우 내에서 수행할 수 있게 한다.
02
Roboflow Workflows는 Qwen 3-VL, SmolVLM 2, Moondream 2와 같은 오픈소스 모델을 사전 배포된 블록 형태로 제공한다. 사용자는 클릭 몇 번으로 모델을 추가하고 서버리스 API, 호스팅 API, 또는 로컬 장치 중 원하는 추론 서버를 선택하여 실행 환경을 최적화할 수 있다.
Roboflow 워크플로우 에디터에서 선택 가능한 VLM 모델 블록 목록
ScreenshotQwen2.5-VL, SmolVLM2, Moondream2 등 Roboflow에서 사전 배포하여 즉시 사용 가능한 다양한 오픈소스 VLM 옵션을 보여준다. 각 모델별로 GPU 필요 여부와 인기 태그가 표시되어 사용자가 용도에 맞는 모델을 선택할 수 있도록 돕는다.
Qwen3-VL 블록의 세부 설정 인터페이스
ScreenshotVLM 블록에서 프롬프트, 모델 버전, 시스템 프롬프트 등을 어떻게 구성하는지 보여준다. 입력 이미지와 텍스트 지침을 결합하여 모델의 동작을 제어하는 구체적인 파라미터 설정을 확인할 수 있다.
워크플로우 실행을 위한 추론 서버 선택 팝업창
Screenshot서버리스 API, 전용 배포, 로컬 장치 등 워크플로우가 실행될 인프라를 선택하는 과정을 보여준다. 특히 로컬 장치 옵션을 통해 사용자의 하드웨어 자원을 활용하는 방법을 제시한다.
03
Google Gemini와 같은 상용 API 모델을 위한 전용 통합 블록을 지원하며, JSON Parser 블록과 결합하여 모델의 텍스트 응답을 구조화된 객체로 변환한다. JSON Parser는 필수 키 존재 여부를 검증하고 에러를 처리하여 다운스트림 로직의 안정성을 보장한다.
04
Custom Python Block을 사용하면 워크플로우 내에서 직접 Python 코드를 작성하여 최신 VLM API를 호출하거나 복잡한 데이터 변환 로직을 구현할 수 있다. 이는 표준 블록으로 제공되지 않는 최신 모델이나 특수한 요청 구조가 필요한 경우에 유연한 확장성을 제공한다.
python
import requests
import base64
import json

def run(self, image, api_key) -> BlockResult:
    model_id = "gemini-3-flash-preview"
    url = f"https://generativelanguage.googleapis.com/v1beta/models/{model_id}:generateContent?key={api_key}"
    payload = {
        "contents": [
            {
                "role": "user",
                "parts": [
                    {"text": "Generate a caption for this image."},
                    {
                        "inlineData": {
                            "mimeType": "image/jpeg",
                            "data": image.base64_image
                        }
                    }
                ]
            }
        ],
        "generationConfig": {
            "thinkingConfig": {
                "thinkingLevel": "MINIMAL"
            },
            "responseMimeType": "application/json",
            "responseSchema": {
                "type": "object",
                "properties": {
                    "caption": {"type": "string"}
                },
                "required": ["caption"]
            }
        }
    }
    headers = {"Content-Type": "application/json"}
    response = requests.post(url, headers=headers, json=payload)
    response.raise_for_status()
    result = response.json()
    caption_json = json.loads(
        result["candidates"][0]["content"]["parts"][0]["text"]
    )
    return {"caption" : caption_json["caption"]}

Roboflow Custom Python Block 내에서 Google Gemini API를 직접 호출하여 이미지 캡션을 생성하는 코드 예시

05
실전 사례로 구축된 자동 이미지 이름 변경 파이프라인은 Gemini 모델이 이미지 내용을 분석해 키워드를 생성하고 이를 파일명으로 활용한다. Roboflow Inference SDK를 사용하면 로컬 폴더의 수많은 스크린샷을 내용에 맞는 의미 있는 이름으로 자동 정리하는 자동화 스크립트를 쉽게 구현할 수 있다.
python
from inference_sdk import InferenceHTTPClient

client = InferenceHTTPClient(
    api_url="https://serverless.roboflow.com",
    api_key="YOUR_ROBOFLOW_API_KEY"
)

# 워크플로우 실행
result = client.run_workflow(
    workspace_name="your-workspace-name",
    workflow_id="filename-generation-workflow",
    images={"image": file_path},
    use_cache=True
)

# 생성된 파일명 추출
generated_name = result[0]["output"]["generated_filename"]
new_filename = generated_name + ext
os.rename(file_path, new_path)

Roboflow SDK를 사용하여 구축된 워크플로우를 호출하고 로컬 파일 이름을 자동으로 변경하는 스크립트

용어 해설

시각-언어 모델(VLM)
이미지와 텍스트를 동시에 이해하고 추론할 수 있는 멀티모달 대형 언어 모델이다. 시각적 인식과 언어 이해를 결합하여 이미지 캡셔닝, 시각적 질의응답(VQA), 복합 추론 등 기존 비전 모델보다 유연한 작업을 수행한다.
로보플로우 워크플로우(Roboflow Workflows)
객체 탐지, 깊이 추정, VLM 추론 등 다양한 컴퓨터 비전 작업을 시각적으로 연결하여 파이프라인을 구축하는 로우코드 도구이다. 복잡한 인프라 설정 없이 여러 모델을 체인으로 묶어 하나의 API 엔드포인트로 배포할 수 있게 해준다.
구조화된 출력(Structured Output)
LLM이 자유 형식의 텍스트 대신 JSON과 같이 정해진 규격에 맞춰 결과를 생성하는 방식이다. 이는 모델의 응답을 후속 프로그래밍 로직에서 파싱 오류 없이 즉시 데이터베이스 저장이나 함수 호출에 사용할 수 있게 한다.
추론 서버(Inference Server)
학습된 AI 모델을 실행하여 실제 예측값을 생성하는 환경을 의미한다. Roboflow는 클라우드 기반의 서버리스 API, 전용 GPU 배포, 또는 사용자 로컬 장치에서 직접 실행하는 로컬 추론 등 다양한 옵션을 제공한다.

기술

  • Roboflow Workflows
  • Google Gemini
  • Qwen 3-VL
  • SmolVLM 2
  • Python
  • Inference SDK

활용 사례

  • 자동 이미지 파일명 변경
  • 시각적 질의응답(VQA) 시스템
  • 지능형 문서 처리 및 OCR
  • 산업용 안전 모니터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 04.수집 2026. 03. 04.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.