본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

openai/clip-vit-base-patch32

Zero-shot 이미지 분류

이미지와 문장 임베딩의 유사도로 임의의 후보 라벨을 예측하는 Zero-shot CLIP 모델

학습 방식 · 공개 이미지-캡션 데이터를 웹 크롤링과 YFCC100M 같은 기존 데이터셋으로 구성하고 이미지·텍스트 Encoder를 contrastive loss로 학습했습니다.

TL;DR

openai/clip-vit-base-patch32는 별도 Fine-tuning 없이 임의의 텍스트 후보와 이미지를 비교하는 기본 CLIP 모델입니다. ViT-B/32 이미지 Encoder와 masked self-attention Transformer 텍스트 Encoder가 이미지-문장 쌍의 유사도를 높이는 contrastive loss로 함께 학습됩니다. 입력 이미지와 후보 문장을 CLIPProcessor로 전처리한 뒤 이미지-텍스트 유사도 점수를 계산하고 softmax 확률로 변환합니다. Zero-shot 분류 연구에 적합하지만 세밀한 분류·객체 수 세기·영어 외 언어·배포 환경에서는 별도 검증이 필요합니다.

핵심 포인트

  • 후보 라벨을 문장으로 입력해 고정된 분류기 없이 이미지와 가장 가까운 텍스트를 선택합니다.
  • ViT-B/32 이미지 Encoder와 masked self-attention 텍스트 Encoder를 contrastive loss로 공동 학습합니다.
  • CLIPProcessor가 이미지와 후보 문장을 묶어 처리하고 이미지-텍스트 유사도를 softmax 확률로 바꿉니다.
  • 클래스 설계에 따라 성능과 편향이 크게 달라져 고정된 분류 체계와 사전 검증이 필요합니다.

제한사항

  • 세밀한 분류와 객체 수 세기에서 성능이 낮을 수 있습니다.
  • 클래스 구성에 따라 인종·성별 관련 편향과 성능 격차가 달라질 수 있습니다.
  • 영어 외 언어로 의도적으로 학습·평가되지 않았으며 배포 용도는 권장 범위 밖입니다.

벤치마크

벤치마크지표비교
Fairface 성별 분류accuracy>96% across all races
Fairface 성별 분류 - Middle Easternaccuracy98.4%
Fairface 성별 분류 - Whiteaccuracy96.5%
Fairface 인종 분류accuracy~93%
Fairface 연령 분류accuracy~63%

1.1k

LIKES

20.6M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.