openai/clip-vit-base-patch32
Zero-shot 이미지 분류
이미지와 문장 임베딩의 유사도로 임의의 후보 라벨을 예측하는 Zero-shot CLIP 모델
학습 방식 · 공개 이미지-캡션 데이터를 웹 크롤링과 YFCC100M 같은 기존 데이터셋으로 구성하고 이미지·텍스트 Encoder를 contrastive loss로 학습했습니다.
TL;DR
openai/clip-vit-base-patch32는 별도 Fine-tuning 없이 임의의 텍스트 후보와 이미지를 비교하는 기본 CLIP 모델입니다. ViT-B/32 이미지 Encoder와 masked self-attention Transformer 텍스트 Encoder가 이미지-문장 쌍의 유사도를 높이는 contrastive loss로 함께 학습됩니다. 입력 이미지와 후보 문장을 CLIPProcessor로 전처리한 뒤 이미지-텍스트 유사도 점수를 계산하고 softmax 확률로 변환합니다. Zero-shot 분류 연구에 적합하지만 세밀한 분류·객체 수 세기·영어 외 언어·배포 환경에서는 별도 검증이 필요합니다.
핵심 포인트
- 후보 라벨을 문장으로 입력해 고정된 분류기 없이 이미지와 가장 가까운 텍스트를 선택합니다.
- ViT-B/32 이미지 Encoder와 masked self-attention 텍스트 Encoder를 contrastive loss로 공동 학습합니다.
- CLIPProcessor가 이미지와 후보 문장을 묶어 처리하고 이미지-텍스트 유사도를 softmax 확률로 바꿉니다.
- 클래스 설계에 따라 성능과 편향이 크게 달라져 고정된 분류 체계와 사전 검증이 필요합니다.
제한사항
- 세밀한 분류와 객체 수 세기에서 성능이 낮을 수 있습니다.
- 클래스 구성에 따라 인종·성별 관련 편향과 성능 격차가 달라질 수 있습니다.
- 영어 외 언어로 의도적으로 학습·평가되지 않았으며 배포 용도는 권장 범위 밖입니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Fairface 성별 분류 | accuracy | >96% across all races | — |
| Fairface 성별 분류 - Middle Eastern | accuracy | 98.4% | — |
| Fairface 성별 분류 - White | accuracy | 96.5% | — |
| Fairface 인종 분류 | accuracy | ~93% | — |
| Fairface 연령 분류 | accuracy | ~63% | — |
1.1k
LIKES
20.6M
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.