본문으로 건너뛰기
Roboflow Blog조회 20

Florence-2 VLM을 활용한 Roboflow 제로샷 오토 레이블링 가이드

Microsoft의 Florence-2 VLM과 Roboflow Workflows를 결합하여 수동 레이블링 없이 제로샷으로 데이터셋을 구축하고 RF-DETR 모델을 학습시키는 전체 파이프라인을 제시한다.

섹션별 상세

01
VLM은 이미지와 텍스트의 관계를 수십억 개의 데이터를 통해 학습하여 별도의 학습 데이터 없이도 '제로샷'으로 객체를 식별할 수 있는 능력을 갖췄다.
02
Microsoft의 Florence-2는 객체 탐지 작업에 특화된 오픈소스 VLM으로, 클래스 이름 리스트를 입력받아 이미지 내 정확한 좌표를 반환하는 고성능 오토 레이블러 역할을 수행한다.
Florence-2 모델이 이미지 내의 인물을 'humans' 클래스로 정확히 탐지하여 바운딩 박스를 표시한 예시이다.
Screenshot제로샷 객체 탐지의 실제 결과물을 보여준다. 모델이 별도의 학습 없이 텍스트 프롬프트만으로 객체의 위치를 정확히 식별할 수 있음을 증명하며, 오토 레이블링의 신뢰성을 시각적으로 확인시켜 준다.
03
Roboflow Workflows를 통해 Florence-2 모델 블록과 'VLM as Detector' 블록을 연결하여 모델의 추론 결과를 구조화된 탐지 데이터로 변환하는 논리 체인을 구성한다.
Florence-2를 활용한 오토 레이블링 워크플로우의 4단계 프로세스 다이어그램이다.
Diagram로직 구축, 배치 처리, 메타데이터 변환, 레이블 재임포트로 이어지는 전체 파이프라인을 시각화했다. 각 단계가 어떻게 연결되어 최종적으로 학습 가능한 데이터셋이 되는지 구조적 이해를 돕는다.
04
로컬 인프런스 서버를 Docker 컨테이너로 실행하여 데이터 보안을 유지하면서 로컬 GPU 자원을 활용해 대량의 이미지를 배치 프로세싱으로 처리한다.
05
배치 처리 결과로 생성된 개별 JSON 파일들을 Python 스크립트로 통합하여 표준 COCO 형식의 주석 파일로 변환함으로써 학습 준비를 마친다.
python
def convert_to_coco(input_folder, output_folder, filename="annotations.coco.json"):
    # ... (중략)
    for file_path in Path(input_folder).glob("*.json"):
        with open(file_path, 'r') as f:
            data = json.load(f)
        
        image_filename = file_path.stem + ".jpg"
        width = data["output_6"]["image"]["width"]
        height = data["output_6"]["image"]["height"]
        
        bbox_data = json.loads(data["output_9"])
        bboxes = bbox_data.get("bboxes", [])
        labels = bbox_data.get("bboxes_labels", [])
        
        for bbox, label in zip(bboxes, labels):
            if label == "humans":
                x1, y1, x2, y2 = bbox
                w = x2 - x1
                h = y2 - y1
                coco_output["annotations"].append({
                    "id": annotation_id,
                    "image_id": image_id,
                    "category_id": 0,
                    "bbox": [float(x1), float(y1), float(w), float(h)],
                    "area": float(w * h),
                    "iscrowd": 0
                })
                annotation_id += 1
        image_id += 1

Florence-2의 원시 JSON 출력을 표준 COCO 형식으로 변환하는 핵심 로직

06
VLM이 생성한 '골드 표준' 데이터셋을 사용하여 실시간 성능이 뛰어난 RF-DETR 모델을 학습시킴으로써 프로덕션 환경에 적합한 고속 모델을 확보한다.

용어 해설

시각 언어 모델(VLM)
이미지와 텍스트를 동시에 이해하도록 훈련된 AI 모델이다. 수십억 개의 이미지-텍스트 쌍을 학습하여 특정 레이블 없이도 '학교 버스'나 '오토바이' 같은 개념적 시각 특징을 파악할 수 있어 범용적인 시각 작업에 활용된다.
제로샷 객체 탐지(Zero-Shot Object Detection)
모델이 학습 과정에서 명시적으로 보지 못한 새로운 객체를 텍스트 프롬프트만으로 찾아내는 기술이다. 별도의 추가 학습 데이터 없이도 일반적인 지식을 활용해 객체의 위치를 식별할 수 있어 초기 데이터셋 구축 비용을 획기적으로 줄여준다.
COCO 형식(COCO Format)
객체 탐지 및 세그멘테이션 데이터셋을 위한 표준 데이터 포맷이다. 이미지 정보, 카테고리, 바운딩 박스 좌표([x, y, width, height]) 등을 JSON 구조로 저장하며, 대부분의 현대적 컴퓨터 비전 프레임워크와 호환된다.
추론 서버(Inference Server)
학습된 AI 모델을 실제 환경에서 실행하기 위한 전용 런타임 환경이다. Docker 컨테이너 기술을 활용해 PyTorch나 CUDA 같은 복잡한 의존성을 관리하며, API 호출을 통해 모델의 예측 결과를 실시간으로 제공하는 역할을 한다.

기술

  • Florence-2
  • RF-DETR
  • Roboflow
  • Docker
  • Python
  • PyTorch
  • CUDA

활용 사례

  • 대규모 이미지 데이터셋 자동 레이블링
  • 제로샷 객체 탐지 시스템 구축
  • VLM 기반 데이터 증강 및 정제
  • 엣지 디바이스용 경량 탐지 모델 학습
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 13.수집 2026. 03. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.