TL;DR
초기 컴퓨터 비전은 CNN 기반의 지도 학습 모델로 특정 데이터셋에만 의존했다. 이후 NLP 분야에서 BERT와 GPT가 대규모 데이터 사전 학습과 파인튜닝을 통해 범용성을 확보한 것과 달리, 비전 모델은 좁은 범위의 라벨링에 갇혀 있었다. CLIP은 이미지와 텍스트 쌍을 대규모로 학습하는 대조 학습을 도입하여 텍스트의 풍부한 맥락을 비전 모델에 이식했다. 이를 통해 모델은 별도의 추가 학습 없이도 새로운 데이터를 분류하는 제로샷 성능을 갖추게 되었고, 특정 작업에 종속되지 않는 범용적인 파운데이션 모델로 진화했다.
챕터별 상세
컴퓨터 비전의 초기 CNN 시대
CNN은 이미지의 특징을 추출하는 신경망 구조로, 2010년대 초반 컴퓨터 비전의 발전을 주도했다.
CNN의 확산과 한계
ResNet은 깊은 신경망 학습을 가능하게 했으며, YOLO와 U-Net은 각각 객체 탐지와 이미지 분할 분야에서 중요한 아키텍처이다.
NLP의 패러다임 변화
사전 학습(Pre-training)과 파인튜닝(Fine-tuning)은 현대 언어 모델의 핵심 학습 전략이다.
CLIP의 등장과 비전 모델의 변화
CLIP은 이미지와 텍스트를 같은 벡터 공간에 매핑하여 상호 이해를 가능하게 한다.
대조 학습을 통한 제로샷 분류
코사인 유사도는 두 벡터 간의 방향성을 측정하여 유사도를 판단하는 지표이다.
CLIP의 성능과 의의
제로샷 성능은 모델의 범용성과 확장성을 평가하는 중요한 지표이다.
용어 해설
- 합성곱 신경망(CNN)
- — 이미지의 공간적 계층 구조를 학습하는 신경망 구조이다. 필터를 사용하여 이미지의 특징을 추출하며, 2012년 AlexNet 이후 컴퓨터 비전의 표준 아키텍처로 자리 잡았다.
- 대조 학습(Contrastive Learning)
- — 데이터 쌍 간의 유사도를 학습하여 표현 공간에서 비슷한 데이터는 가깝게, 다른 데이터는 멀게 배치하는 기법이다. CLIP에서는 이미지와 텍스트 쌍을 정렬하는 데 사용되었다.
- 제로샷 예측(Zero-shot Prediction)
- — 모델이 학습 과정에서 보지 못한 새로운 데이터나 클래스에 대해 추가적인 파인튜닝 없이 추론을 수행하는 능력이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



