본문으로 건너뛰기

DeepSeek 비전 모델 가이드: DeepSeek-VL부터 Janus-Pro까지

DeepSeek가 출시한 다양한 오픈 웨이트 비전-언어 모델들의 아키텍처와 주요 기능을 살펴보고, Roboflow Supervision을 활용한 실전 적용 방법을 제시한다.

섹션별 상세

DeepSeek-VL 시리즈는 SigLIP과 SAM을 결합한 하이브리드 비전 인코더를 사용한다. SigLIP-L은 전반적인 의미론적 이해를 담당하고 SAM-B는 미세한 시각적 세부 사항을 캡처하여 고해상도 이미지와 문서 처리에 최적화된 성능을 보여준다. 2세대 모델인 DeepSeek-VL2는 이미지를 여러 타일로 나누어 처리하는 동적 타일링 기술을 도입하여 OCR 및 차트 분석 능력을 대폭 향상시켰다.
DeepSeek-VL2의 인컨텍스트 비주얼 그라운딩 예시 이미지
Screenshot모델이 첫 번째 이미지의 특정 객체를 참조하여 두 번째 이미지에서 동일한 카테고리의 객체를 찾아내는 과정을 보여준다. 이는 모델이 문맥을 이해하고 시각적 접지를 수행하는 능력을 증명한다.
Janus 시리즈는 이미지 이해와 생성을 하나의 통합된 아키텍처 내에서 구현한다. 기존 모델들과 달리 이해와 생성을 위한 시각적 인코딩 경로를 분리하면서도 공유된 자동 회귀 트랜스포머를 통해 데이터를 처리한다. 특히 JanusFlow는 Rectified Flow 기법을 도입하여 복잡한 구조 변경 없이도 자연스러운 이미지 생성을 가능하게 하며, Janus-Pro는 최적화된 학습 전략과 확장된 데이터를 통해 성능을 더욱 강화했다.
Janus 모델의 3단계 학습 파이프라인 다이어그램
Diagram어댑터 학습, 공동 VL 사전 학습, 지도 미세 조정(SFT)으로 이어지는 Janus의 학습 과정을 시각화한다. 각 단계에서 언어 모델과 비전 인코더의 동결 여부를 명시하여 아키텍처 이해를 돕는다.
JanusFlow의 통합 멀티모달 아키텍처 구조
Diagram공유된 LLM 백본을 중심으로 이해(Autoregression)와 생성(Rectified Flow) 경로가 어떻게 분리되고 통합되는지 보여준다. 텍스트 토크나이저와 이미지 디코더 간의 데이터 흐름을 명확히 설명한다.
Janus-Pro의 아키텍처 및 학습 전략 개요
DiagramJanus-Pro가 기존 Janus 대비 개선된 학습 전략과 데이터 확장 방식을 채택했음을 시각적으로 나타낸다. 1B 및 7B 모델 크기로의 확장성과 최적화된 이미지 헤드 학습 과정을 포함한다.
DeepSeek-OCR 시리즈는 긴 문서와 복잡한 레이아웃 이해에 특화된 전문가 모델이다. 문서를 시각적 압축 문제로 접근하여 적은 수의 비전 토큰으로도 페이지 정보를 유지하는 DeepEncoder를 사용한다. 최신 버전인 DeepSeek-OCR 2는 인간의 시각적 흐름을 모방한 Visual Causal Flow 아키텍처를 도입하여 고정된 스캔 방식 대신 의미론적 순서에 따라 토큰을 재구성함으로써 레이아웃 인식 능력을 높였다.
Roboflow Supervision 라이브러리를 통해 DeepSeek-VL2의 텍스트 응답을 표준 객체 탐지 포맷으로 변환할 수 있다. 모델이 생성한 좌표 토큰을 sv.Detections.from_vlm() 함수로 파싱하여 Bounding Box와 클래스 이름을 추출한다. 이 과정을 거치면 VLM의 출력을 기존의 YOLO와 같은 전용 탐지 모델처럼 시각화, 필터링 및 추적 파이프라인에 즉시 통합하여 사용할 수 있다.
python
import supervision as sv
from PIL import Image

image = Image.open("giraffe.png")
deepseek_vl2_result = (
    "The giraffe at the back"
    "[[580, 270, 999, 904]]"
    "The giraffe at the front"
    "[[26, 31, 632, 998]]"
)

detections = sv.Detections.from_vlm(
    vlm=sv.VLM.DEEPSEEK_VL_2,
    result=deepseek_vl2_result,
    resolution_wh=image.size
)

print(detections.xyxy)
print(detections.data["class_name"])

DeepSeek-VL2의 텍스트 출력을 Roboflow Supervision을 사용하여 정형화된 객체 탐지 데이터로 변환하는 예시

용어 해설

전문가 혼합 모델(Mixture-of-Experts (MoE))
전체 파라미터 중 일부 전문가 네트워크만 활성화하여 추론 효율성을 높이는 아키텍처이다. DeepSeek 모델들은 이를 통해 적은 연산량으로도 거대 모델 수준의 성능을 달성한다.
시각적 접지(Visual Grounding)
자연어 설명에 해당하는 이미지 내 객체의 위치를 좌표(Bounding Box) 형태로 찾아내는 기술이다. 텍스트 쿼리를 기반으로 특정 사물을 식별하고 위치를 파악하는 데 필수적이다.
렉티파이드 플로우(Rectified Flow)
이미지 생성 과정에서 노이즈로부터 데이터를 생성하는 경로를 직선화하여 효율성을 높이는 기법이다. JanusFlow 모델에서 이미지 이해와 생성을 하나의 프레임워크로 통합하는 데 사용된다.
동적 타일링(Dynamic Tiling)
고해상도 이미지를 여러 개의 작은 타일로 나누어 처리함으로써 세부 정보를 보존하는 방식이다. DeepSeek-VL2에서 문서나 차트의 미세한 텍스트를 정확히 인식하기 위해 도입되었다.
멀티헤드 잠재 어텐션(Multi-head Latent Attention (MLA))
KV 캐시를 잠재 벡터로 압축하여 추론 시 메모리 사용량을 획기적으로 줄이는 어텐션 메커니즘이다. 긴 멀티모달 시퀀스를 처리할 때 높은 효율성을 제공한다.

기술

  • DeepSeek-VL2
  • Janus-Pro
  • Roboflow Supervision
  • SigLIP
  • SAM
  • PyTorch

활용 사례

  • 문서 자동화 및 데이터 추출
  • 제로샷 객체 탐지 및 접지
  • 텍스트 기반 이미지 생성 및 편집
  • 차트 및 대시보드 시각적 분석
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 21.수집 2026. 03. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.