이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
VLM은 이미지와 영상을 vision encoder로 임베딩한 뒤 projector를 거쳐 LLM에 전달하며, CLIP과 SigLIP은 주로 학습 손실 함수에서 갈립니다. CLIP은 배치 전체의 이미지와 caption을 비교하는 similarity matrix에 softmax 기반 contrastive learning을 적용해 정답 쌍을 고르도록 학습합니다. 이 과정에서는 하나의 이미지와 잘 맞는 여러 caption이 batch 안에서 경쟁할 수 있습니다. SigLIP은 각 image-caption 쌍을 sigmoid 기반의 독립적인 이진 예측으로 처리해 이 경쟁과 전역 정규화를 없애고, 대규모 분산 학습에 적합한 구조를 취합니다.
섹션별 상세
VLM이 classification이나 video question and answer를 수행하려면 먼저 이미지나 영상을 수치 표현으로 변환해야 하며, 이 역할을 pretrained vision encoder가 맡습니다. Transformer 기반 인코더는 이미지를 patch로 나누고 각 patch를 visual embedding으로 바꾼 뒤, projector가 그 차원을 LLM에 맞춥니다. 따라서 CLIP과 SigLIP의 핵심 차이는 주로 구조가 아니라 어떤 학습 목표와 손실 함수를 사용하는지에 있습니다.
CLIP은 ViT 기반 image encoder와 text encoder에서 각각 임베딩을 만든 뒤, 모든 이미지와 text의 cosine similarity를 담은 similarity matrix를 구성합니다. 행과 열 방향에 softmax를 적용해 정답 image-text 쌍과 text-image 쌍에 가장 높은 확률을 부여하는 contrastive learning을 수행합니다. 이 방식은 zero-shot classification과 의미적 이해를 가능하게 하지만, 같은 batch 안에서 하나의 이미지와 잘 맞는 여러 caption이 서로 경쟁하는 구조적 문제를 만듭니다.
SigLIP은 image encoder, text encoder, 임베딩, similarity matrix라는 큰 틀을 CLIP과 공유하지만 손실 함수에서 차이를 둡니다. 배치 전체에 softmax를 적용하는 대신 각 image-caption 쌍의 점수에 sigmoid를 적용해 독립적으로 유효한 일치인지 이진 예측합니다. 모든 샘플이 하나의 공유 정규화 연산에 참여할 필요가 없어 대규모 distributed system에서 학습 목표를 더 효율적으로 확장할 수 있습니다.
용어 해설
- 비전 인코더(Vision Encoder)
- — 이미지를 VLM이 처리할 수 있는 수치 표현으로 변환하는 모듈입니다. Transformer가 이미지를 여러 패치로 나누고 각 패치를 벡터 임베딩으로 바꾸며, 이후 projector가 이 표현의 차원을 LLM이 요구하는 형태에 맞춥니다.
- 프로젝터(Projector)
- — Vision Encoder가 만든 이미지 임베딩의 차원을 LLM의 입력 차원에 맞게 변환하는 계층입니다. 일반적으로 선형 계층이나 MLP를 사용해 시각 정보와 언어 모델 사이의 표현 공간을 연결합니다.
- 대조 학습(Contrastive Learning)
- — 서로 의미가 맞는 표현은 가깝게 만들고 맞지 않는 표현은 멀리 떨어뜨리도록 학습하는 방법입니다. CLIP에서는 이미지와 caption의 유사도를 비교한 행렬에 softmax와 cross entropy를 적용해 일치하는 쌍의 확률을 높입니다.
- 코사인 유사도(Cosine Similarity)
- — 고차원 임베딩 공간에서 두 벡터가 이루는 각도의 코사인값으로 의미적 유사도를 측정하는 방식입니다. 두 벡터의 내적을 각 벡터 길이의 곱으로 나누며, 의미가 가까울수록 더 높은 값을 냅니다.
- 제로샷 분류(Zero-shot Classification)
- — 모델이 분류 대상으로 직접 학습하지 않은 클래스도 이미지와 텍스트의 의미적 정렬을 이용해 분류하는 방식입니다. CLIP은 단순한 고정 label 학습을 넘어 image-caption 관계를 학습하기 때문에 이런 분류가 가능합니다.
- 시그모이드 손실(Sigmoid Loss)
- — 각 이미지-caption 쌍을 서로 독립적인 이진 예측으로 평가하는 손실 함수입니다. SigLIP은 각 쌍의 점수에 sigmoid를 적용해 유효한 일치인지 true 또는 false로 판단하므로, 배치 전체를 하나의 softmax 정규화에 묶지 않습니다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 17.수집 2026. 08. 17.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
