TL;DR
CAPI는 효율적인 로컬 패치 표현 학습에 강점이 있으나 전역 임베딩이 부족하다는 한계가 있다. 이를 해결하기 위해 CAPI 학습 구조에 DINO 목적 함수를 추가하여 전역 표현을 학습시키는 하이브리드 방식을 실험했다. 실험 결과 iNat21 데이터셋에서 68.7%의 선형 프로빙 정확도를 기록했으며, 기존 Bio-DINO 대비 16%의 연산량으로 효율성을 유지했다. 다만 로컬 특징의 품질 저하와 학습 불안정성이 관찰되어 DINO 손실 가중치 조절 등 추가적인 최적화가 필요하다.
실용적 조언
- CAPI와 DINO를 결합할 때 DINO 손실 가중치를 낮게 설정하여 학습 안정성을 확보하는 것이 좋다.
섹션별 상세
이미지 분석

CAPI의 로컬 패치 수준 학습 구조를 시각화하여, 기존 방식의 작동 원리를 설명한다.
CAPI 학습 방식의 구조를 보여주는 다이어그램이다.

기존 CAPI 구조에 DINO 헤드를 추가하여 전역 표현을 학습시키는 변경 사항을 보여준다.
CAPI와 DINO를 결합한 하이브리드 학습 구조 다이어그램이다.

기존 Bio-DINO 모델의 학습 결과와 특징을 보여준다.
Bio-DINO 데이터셋 학습 결과 예시이다.

새로 제안된 하이브리드 모델의 특징과 성능을 보여준다.
CAPI-DINO 결합 모델의 학습 결과 예시이다.
용어 해설
- CAPI
- — 로컬 패치 수준의 표현 학습에 최적화된 자기지도학습(SSL) 방식이다. 적은 데이터와 연산량으로도 효율적인 학습이 가능하지만, 전역 이미지 임베딩을 직접 생성하지 못하는 한계가 있다.
- DINO
- — 자기 증류(Self-distillation)를 통해 레이블 없이 전역적인 시각적 특징을 학습하는 방법론이다. 이미지의 전역 표현을 추출하는 데 강점이 있다.
- 선형 프로빙(Linear Probing)
- — 학습된 모델의 가중치를 고정한 상태에서 마지막에 선형 분류기만을 학습시켜 표현의 품질을 평가하는 방법이다.
언급된 도구
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
