챕터별 상세
00:00
배경 및 기존 연구의 한계
최근 제로샷 이상 탐지 트렌드는 CLIP의 이미지-텍스트 피처 유사도를 이용하는 방식이다. WinCLIP은 텍스트 프롬프트를 활용해 정상과 이상을 구분하지만 테스트 이미지의 정상 정보를 활용하지 못한다. 반면 Mutual Scoring은 테스트 이미지 전체를 참조 이미지로 사용해 성능을 높였으나, 실시간 추론이 필요한 환경에서는 비실용적이라는 단점이 존재한다.
02:49
FiCLIP-AD의 핵심 아키텍처: SeCLIP-AD
SeCLIP-AD는 CLIP의 텍스트-비전 정렬 능력을 활용하는 기본 컴포넌트이다. 정상과 비정상을 나타내는 다양한 텍스트 프롬프트의 클래스 토큰 평균을 텍스트 피처로 사용한다. 비전 인코더에서 추출된 패치 피처와 텍스트 피처 간의 유사도를 계산하여 최종적인 어노말리 세그멘테이션 맵을 생성하는 구조를 가진다.
04:34
시맨틱 상관관계 복원 (Semantic Correlation Recovery)
CLIP 비전 인코더의 마지막 레이어에서 발생하는 시맨틱 정보 손실을 보완하는 기법이다. 연구 결과 마지막 24번째 레이어보다 중간 단계인 12번째 레이어의 어텐션 맵이 객체의 국소적 의미 정보를 더 잘 보존하고 있음이 확인됐다. 이에 따라 마지막 레이어의 피처 대신 중간 레이어의 어텐션 값을 활용하여 이상 탐지의 정밀도를 높였다.
05:19
상호 필터링 마스크 (Mutual-filtering Mask)
참조 이미지 내에 포함된 이상 패치가 성능을 떨어뜨리는 노이즈 문제를 해결하기 위해 제안됐다. SeCLIP-AD의 초기 결과를 바탕으로 이상 확률이 높은 패치를 마스킹하여 참조 피처에서 제외한다. 단 두 장의 이미지만 사용하는 Dual-image 구성에서도 효과적으로 작동하도록 설계되었으며, 여러 레이어와 이웃 정보를 활용해 마스크를 정교화한다.
text
Algorithm 1: Noise mutual filtering
Input: Starting masks Mu and Mv, inference
For r = 1, 3, 5 do
For l in {6, 12, 18, 24} do
F_u_hat = F_u * M_u, F_v_hat = F_v * M_v
a_uv = min ||F_u_hat - F_v_hat||
End
a_uv_avg = mean(a_uv)
M_inter = (a_uv_avg > mu)
M_u = vote(M_u, M_inter)
End노이즈 특징을 제거하기 위한 상호 필터링 알고리즘의 의사코드
08:38
실험 결과 및 성능 분석
MVTec AD와 VisA 데이터셋에서 실험을 진행한 결과, 기존 Mutual Scoring 대비 AUROC 성능이 향상됐다. 특히 세그멘테이션 성능에서 뚜렷한 우위를 보였으며, 단 한 쌍의 이미지만 사용하는 원샷 환경에서도 높은 성능을 유지했다. 필터링 기법 적용 후 이상 점수의 평균값이 0.49에서 0.57로 증가하며 정상과 이상의 구분력이 강화됨을 시각적으로 증명했다.
용어 해설
- 제로샷 이상 탐지(Zero-shot Anomaly Detection)
- — 학습 단계에서 특정 도메인의 정상 또는 이상 데이터를 전혀 사용하지 않고, 사전 학습된 모델의 지식만을 활용하여 새로운 이미지 내의 결함을 찾아내는 기술이다. 데이터 수집이 어려운 제조 현장에서 유용하며 CLIP과 같은 파운데이션 모델이 주로 활용된다.
- 상호 스코어링(Mutual Scoring)
- — 테스트 이미지들 사이의 유사도를 계산하여 이상 여부를 판단하는 기법이다. 배치 내의 다른 이미지들을 참조 이미지로 활용하여 정상 특징을 정의하지만, 모든 테스트 이미지를 한꺼번에 처리해야 하는 비실용적인 측면이 존재한다.
- 시맨틱 상관관계 복원(Semantic Correlation Recovery)
- — 딥러닝 모델의 마지막 레이어에서 발생하는 정보 손실을 방지하기 위해 중간 레이어의 특징 정보를 다시 가져와 결합하는 기법이다. 본 논문에서는 CLIP의 12번째 레이어 어텐션이 객체의 의미 정보를 가장 잘 보존한다는 점에 착안하여 이를 활용했다.
- 수신자 조작 특성 곡선 아래 면적(AUROC)
- — 이진 분류 모델의 성능을 평가하는 지표로, 1에 가까울수록 모델의 분류 성능이 우수함을 의미한다. 이상 탐지 분야에서는 정상과 이상 데이터를 얼마나 정확하게 구분하는지를 측정하는 표준 지표로 사용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 10.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

