본문으로 건너뛰기

프로토타입 메모리 기반 이미지 분류 구조

4단계 Encoder가 만든 128차원 Signature를 Prototype Memory와 비교해 이미지를 분류하는 구조입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

제공된 자료는 3×64×64 입력 이미지를 4개 Stage와 Residual Block으로 구성된 Encoder에 통과시킨 뒤, 2×2 Global Average Pooling과 Dropout, 128차원 Linear Layer로 Signature를 생성하는 이미지 분류 구조입니다. Signature에는 L2 Normalization을 적용하고, 학습된 가중치를 담은 Prototype Memory와 Cosine Similarity를 계산합니다. 계산된 유사도는 Geometric Cross-Entropy 손실을 거쳐 최종 Classification으로 연결됩니다. 다만 게시물에는 모델명, 데이터셋, 성능 수치, 학습 설정 또는 비교 실험이 포함되어 있지 않습니다.

섹션별 상세

01
입력은 3×64×64 크기의 이미지이며, 4개 Stage와 Residual Block으로 구성된 Encoder가 계층적인 시각 특징을 추출합니다. Encoder 출력은 2×2 Global Average Pooling으로 공간 차원을 축약하고 Dropout을 거친 뒤 Linear Layer에서 128차원 Signature로 변환됩니다. 이처럼 고정된 차원의 표현을 만들기 때문에 이후 클래스 대표값과의 비교를 하나의 벡터 공간에서 수행할 수 있습니다.
3×64×64 입력 이미지가 4개 Stage의 Encoder와 2×2 Global Average Pooling, Dropout, 128차원 Linear Layer를 거쳐 Signature로 변환되는 흐름도입니다.
Diagram도식은 이미지 특징 추출부터 분류까지의 전체 처리 경로를 나타냅니다. 128차원 Signature를 L2 정규화한 뒤 Prototype Memory와 Cosine Similarity를 계산하고, Geometric Cross-Entropy를 통해 Classification으로 연결하는 방식입니다.
3×64×64 입력 이미지부터 Prototype Memory 기반 Classification까지 이어지는 Encoder·Projector 처리 구조를 나타낸 흐름도입니다.
Diagram이미지는 4개 Stage의 Residual Block Encoder와 128차원 Projector를 거친 특징 표현 생성 과정을 담고 있습니다. L2 Normalization 이후 프로토타입과의 Cosine Similarity를 Geometric Cross-Entropy에 사용해 분류하는 학습 경로가 표시되어 있습니다.
02
생성된 128차원 Signature는 L2 Normalization을 거쳐 Prototype Memory의 학습된 가중치와 Cosine Similarity를 계산합니다. 입력 이미지의 표현과 각 클래스 프로토타입 사이의 유사도 점수가 분류 신호가 되고, Geometric Cross-Entropy가 이 관계를 손실로 바꾸어 학습에 사용합니다. 일반적인 최종 분류층만 두는 대신 클래스별 대표 표현과의 거리를 분류 과정에 직접 연결한 구조입니다.

용어 해설

프로토타입 메모리(Prototype Memory)
분류 대상별로 학습된 대표 가중치를 저장하고, 입력 이미지에서 추출한 특징 벡터와 비교하는 메모리 구조입니다. 이 도식에서는 128차원 Signature를 L2 정규화한 뒤 Prototype Memory의 값과 Cosine Similarity를 계산해 분류 손실에 연결합니다. 클래스별 대표 표현과 입력 표현의 거리를 학습에 활용하는 방식입니다.
글로벌 평균 풀링(Global Average Pooling)
공간 차원에 걸쳐 특징값의 평균을 계산해 각 채널을 하나의 값으로 축약하는 연산입니다. 도식에서는 2×2 GAP가 Encoder 출력의 공간 정보를 줄인 뒤 Dropout과 Linear Layer를 거칩니다. 이 과정을 통해 최종 128차원 Signature를 만들기 위한 입력 표현을 구성합니다.
L2 정규화(L2 Normalization)
특징 벡터의 L2 노름으로 각 성분을 나누어 벡터 크기를 일정하게 맞추는 처리입니다. 도식에서는 Linear Layer가 만든 128차원 Signature 뒤에 L2 Normalization을 적용하고, 정규화된 벡터를 Prototype Memory와의 Cosine Similarity 계산에 사용합니다. 벡터 크기보다 방향 기반 비교를 학습에 반영하는 단계입니다.
코사인 유사도(Cosine Similarity)
두 벡터가 이루는 각도의 코사인값으로 표현의 방향 유사성을 계산하는 방법입니다. 이 구조에서는 L2 정규화된 이미지 Signature와 Prototype Memory의 학습 가중치를 비교해 각 클래스와의 유사도 점수를 얻습니다. 그 점수는 Geometric Cross-Entropy와 Classification 단계로 이어집니다.
기하학적 교차 엔트로피(Geometric Cross-Entropy)
분류 확률만 비교하는 대신 특징 공간의 기하학적 관계를 반영하도록 구성한 교차 엔트로피 손실입니다. 도식에서는 이미지 Signature와 Prototype Memory 사이의 Cosine Similarity를 입력으로 받아 분류 학습에 사용합니다. 따라서 Encoder와 Projector가 클래스별 대표 표현에 가까운 128차원 특징을 만들도록 최적화하는 역할을 합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.