섹션별 상세
VLMs는 Gemini 3, GPT-5와 같은 상용 모델과 Qwen 3, LLaMA 3와 같은 오픈소스 모델을 포함하며 시각적 인식과 언어 추론을 결합한다. 이러한 모델들은 이미지 캡셔닝, 시각적 질의응답(VQA), OCR 기반 추론 등 다양한 컴퓨터 비전 작업을 단일 워크플로우 내에서 수행할 수 있게 한다.
Roboflow Workflows는 Qwen 3-VL, SmolVLM 2, Moondream 2와 같은 오픈소스 모델을 사전 배포된 블록 형태로 제공한다. 사용자는 클릭 몇 번으로 모델을 추가하고 서버리스 API, 호스팅 API, 또는 로컬 장치 중 원하는 추론 서버를 선택하여 실행 환경을 최적화할 수 있다.



Google Gemini와 같은 상용 API 모델을 위한 전용 통합 블록을 지원하며, JSON Parser 블록과 결합하여 모델의 텍스트 응답을 구조화된 객체로 변환한다. JSON Parser는 필수 키 존재 여부를 검증하고 에러를 처리하여 다운스트림 로직의 안정성을 보장한다.
Custom Python Block을 사용하면 워크플로우 내에서 직접 Python 코드를 작성하여 최신 VLM API를 호출하거나 복잡한 데이터 변환 로직을 구현할 수 있다. 이는 표준 블록으로 제공되지 않는 최신 모델이나 특수한 요청 구조가 필요한 경우에 유연한 확장성을 제공한다.
python
import requests
import base64
import json
def run(self, image, api_key) -> BlockResult:
model_id = "gemini-3-flash-preview"
url = f"https://generativelanguage.googleapis.com/v1beta/models/{model_id}:generateContent?key={api_key}"
payload = {
"contents": [
{
"role": "user",
"parts": [
{"text": "Generate a caption for this image."},
{
"inlineData": {
"mimeType": "image/jpeg",
"data": image.base64_image
}
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "MINIMAL"
},
"responseMimeType": "application/json",
"responseSchema": {
"type": "object",
"properties": {
"caption": {"type": "string"}
},
"required": ["caption"]
}
}
}
headers = {"Content-Type": "application/json"}
response = requests.post(url, headers=headers, json=payload)
response.raise_for_status()
result = response.json()
caption_json = json.loads(
result["candidates"][0]["content"]["parts"][0]["text"]
)
return {"caption" : caption_json["caption"]}Roboflow Custom Python Block 내에서 Google Gemini API를 직접 호출하여 이미지 캡션을 생성하는 코드 예시
실전 사례로 구축된 자동 이미지 이름 변경 파이프라인은 Gemini 모델이 이미지 내용을 분석해 키워드를 생성하고 이를 파일명으로 활용한다. Roboflow Inference SDK를 사용하면 로컬 폴더의 수많은 스크린샷을 내용에 맞는 의미 있는 이름으로 자동 정리하는 자동화 스크립트를 쉽게 구현할 수 있다.
python
from inference_sdk import InferenceHTTPClient
client = InferenceHTTPClient(
api_url="https://serverless.roboflow.com",
api_key="YOUR_ROBOFLOW_API_KEY"
)
# 워크플로우 실행
result = client.run_workflow(
workspace_name="your-workspace-name",
workflow_id="filename-generation-workflow",
images={"image": file_path},
use_cache=True
)
# 생성된 파일명 추출
generated_name = result[0]["output"]["generated_filename"]
new_filename = generated_name + ext
os.rename(file_path, new_path)Roboflow SDK를 사용하여 구축된 워크플로우를 호출하고 로컬 파일 이름을 자동으로 변경하는 스크립트
용어 해설
- 시각-언어 모델(VLM)
- — 이미지와 텍스트를 동시에 이해하고 추론할 수 있는 멀티모달 대형 언어 모델이다. 시각적 인식과 언어 이해를 결합하여 이미지 캡셔닝, 시각적 질의응답(VQA), 복합 추론 등 기존 비전 모델보다 유연한 작업을 수행한다.
- 로보플로우 워크플로우(Roboflow Workflows)
- — 객체 탐지, 깊이 추정, VLM 추론 등 다양한 컴퓨터 비전 작업을 시각적으로 연결하여 파이프라인을 구축하는 로우코드 도구이다. 복잡한 인프라 설정 없이 여러 모델을 체인으로 묶어 하나의 API 엔드포인트로 배포할 수 있게 해준다.
- 구조화된 출력(Structured Output)
- — LLM이 자유 형식의 텍스트 대신 JSON과 같이 정해진 규격에 맞춰 결과를 생성하는 방식이다. 이는 모델의 응답을 후속 프로그래밍 로직에서 파싱 오류 없이 즉시 데이터베이스 저장이나 함수 호출에 사용할 수 있게 한다.
- 추론 서버(Inference Server)
- — 학습된 AI 모델을 실행하여 실제 예측값을 생성하는 환경을 의미한다. Roboflow는 클라우드 기반의 서버리스 API, 전용 GPU 배포, 또는 사용자 로컬 장치에서 직접 실행하는 로컬 추론 등 다양한 옵션을 제공한다.
기술
- Roboflow Workflows
- Google Gemini
- Qwen 3-VL
- SmolVLM 2
- Python
- Inference SDK
활용 사례
- 자동 이미지 파일명 변경
- 시각적 질의응답(VQA) 시스템
- 지능형 문서 처리 및 OCR
- 산업용 안전 모니터링
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 04.수집 2026. 03. 04.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.