섹션별 상세
VLM은 이미지와 텍스트의 관계를 수십억 개의 데이터를 통해 학습하여 별도의 학습 데이터 없이도 '제로샷'으로 객체를 식별할 수 있는 능력을 갖췄다.
Microsoft의 Florence-2는 객체 탐지 작업에 특화된 오픈소스 VLM으로, 클래스 이름 리스트를 입력받아 이미지 내 정확한 좌표를 반환하는 고성능 오토 레이블러 역할을 수행한다.

Roboflow Workflows를 통해 Florence-2 모델 블록과 'VLM as Detector' 블록을 연결하여 모델의 추론 결과를 구조화된 탐지 데이터로 변환하는 논리 체인을 구성한다.

로컬 인프런스 서버를 Docker 컨테이너로 실행하여 데이터 보안을 유지하면서 로컬 GPU 자원을 활용해 대량의 이미지를 배치 프로세싱으로 처리한다.
배치 처리 결과로 생성된 개별 JSON 파일들을 Python 스크립트로 통합하여 표준 COCO 형식의 주석 파일로 변환함으로써 학습 준비를 마친다.
python
def convert_to_coco(input_folder, output_folder, filename="annotations.coco.json"):
# ... (중략)
for file_path in Path(input_folder).glob("*.json"):
with open(file_path, 'r') as f:
data = json.load(f)
image_filename = file_path.stem + ".jpg"
width = data["output_6"]["image"]["width"]
height = data["output_6"]["image"]["height"]
bbox_data = json.loads(data["output_9"])
bboxes = bbox_data.get("bboxes", [])
labels = bbox_data.get("bboxes_labels", [])
for bbox, label in zip(bboxes, labels):
if label == "humans":
x1, y1, x2, y2 = bbox
w = x2 - x1
h = y2 - y1
coco_output["annotations"].append({
"id": annotation_id,
"image_id": image_id,
"category_id": 0,
"bbox": [float(x1), float(y1), float(w), float(h)],
"area": float(w * h),
"iscrowd": 0
})
annotation_id += 1
image_id += 1Florence-2의 원시 JSON 출력을 표준 COCO 형식으로 변환하는 핵심 로직
VLM이 생성한 '골드 표준' 데이터셋을 사용하여 실시간 성능이 뛰어난 RF-DETR 모델을 학습시킴으로써 프로덕션 환경에 적합한 고속 모델을 확보한다.
용어 해설
- 시각 언어 모델(VLM)
- — 이미지와 텍스트를 동시에 이해하도록 훈련된 AI 모델이다. 수십억 개의 이미지-텍스트 쌍을 학습하여 특정 레이블 없이도 '학교 버스'나 '오토바이' 같은 개념적 시각 특징을 파악할 수 있어 범용적인 시각 작업에 활용된다.
- 제로샷 객체 탐지(Zero-Shot Object Detection)
- — 모델이 학습 과정에서 명시적으로 보지 못한 새로운 객체를 텍스트 프롬프트만으로 찾아내는 기술이다. 별도의 추가 학습 데이터 없이도 일반적인 지식을 활용해 객체의 위치를 식별할 수 있어 초기 데이터셋 구축 비용을 획기적으로 줄여준다.
- COCO 형식(COCO Format)
- — 객체 탐지 및 세그멘테이션 데이터셋을 위한 표준 데이터 포맷이다. 이미지 정보, 카테고리, 바운딩 박스 좌표([x, y, width, height]) 등을 JSON 구조로 저장하며, 대부분의 현대적 컴퓨터 비전 프레임워크와 호환된다.
- 추론 서버(Inference Server)
- — 학습된 AI 모델을 실제 환경에서 실행하기 위한 전용 런타임 환경이다. Docker 컨테이너 기술을 활용해 PyTorch나 CUDA 같은 복잡한 의존성을 관리하며, API 호출을 통해 모델의 예측 결과를 실시간으로 제공하는 역할을 한다.
기술
- Florence-2
- RF-DETR
- Roboflow
- Docker
- Python
- PyTorch
- CUDA
활용 사례
- 대규모 이미지 데이터셋 자동 레이블링
- 제로샷 객체 탐지 시스템 구축
- VLM 기반 데이터 증강 및 정제
- 엣지 디바이스용 경량 탐지 모델 학습
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 13.수집 2026. 03. 13.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.