챕터별 상세
00:00
연구 배경 및 코어셋 선택의 필요성
딥러닝 모델 학습 시 고품질 라벨 데이터를 얻는 데 드는 시간과 비용을 줄이기 위해 코어셋 선택이 필요하다. 기존의 SOTA 코어셋 선택 방식은 학습 동역학을 측정하기 위해 정답 라벨이 미리 있어야 한다는 모순이 존재한다. ELFS는 이러한 라벨 의존성 문제를 해결하여 라벨 없이도 정보량이 많고 대표성 있는 데이터 서브셋을 선택하는 것을 목표로 한다.
01:35
기존 방법론의 한계와 ELFS의 접근 방식
기존의 라벨 없는 방식은 데이터 간의 거리나 클러스터 구조 등 단순한 기하학적 정보에만 의존하여 실제 모델 학습과의 연관성이 낮다. 반면 라벨 기반 방식은 학습 중 모델의 행동 변화를 관찰하는 학습 동역학 지표를 사용해 성능이 좋지만 라벨이 필수적이다. ELFS는 이 간극을 메우기 위해 딥 클러스터링으로 의사 라벨을 생성하고 이를 통해 학습 동역학을 프록시 형태로 계산한다.
학습 동역학은 모델이 특정 데이터를 얼마나 빨리 학습하거나 잊어버리는지를 나타내는 지표이다.
05:20
딥 클러스터링을 통한 의사 라벨 생성
ELFS는 사전 학습된 비전 인코더를 통해 데이터의 임베딩을 추출하고 TEMI라는 딥 클러스터링 기법을 적용한다. TEMI는 티처 앙상블과 포인트와이즈 상호 정보량을 결합하여 노이즈가 섞인 이웃 데이터 문제를 완화한다. 이를 통해 각 데이터 포인트에 신뢰도 높은 의사 라벨을 부여하며, 이 라벨은 이후 학습 동역학 점수를 산출하는 기준이 된다.
TEMI는 Teacher-Ensemble-weighted Pointwise Mutual Information의 약자로 클러스터링 품질을 높이는 기법이다.
13:38
더블 엔드 프루닝을 이용한 데이터 선택
의사 라벨로 계산된 난이도 점수는 실제 라벨 기반 점수와 분포 차이가 발생하는 편향 문제가 있다. ELFS는 이를 해결하기 위해 너무 어려운 샘플과 너무 쉬운 샘플을 모두 제거하는 더블 엔드 프루닝을 수행한다. 너무 어려운 샘플은 의사 라벨 노이즈일 가능성이 크고, 너무 쉬운 샘플은 정보량이 적기 때문에 중간 난이도의 샘플들을 코어셋으로 확보하여 학습 효율을 극대화한다.
AUM 점수가 너무 높으면 너무 쉬운 데이터, 너무 낮으면 노이즈일 확률이 높다는 가설에 기반한다.
17:10
실험 결과 및 성능 분석
CIFAR-10, CIFAR-100, ImageNet-1K 등 4가지 비전 벤치마크에서 실험을 진행했다. ELFS는 기존의 라벨 없는 방식들을 모든 프루닝 비율에서 일관되게 압도하는 성과를 냈다. 특히 데이터의 30~50%만 사용했을 때도 전체 데이터를 사용한 지도 학습 기반 코어셋 선택 방식에 준하는 성능을 보였으며, 다양한 모델 아키텍처에서도 효과가 전이됨을 확인했다.
용어 해설
- 코어셋 선택(Coreset Selection)
- — 대규모 데이터셋에서 모델의 성능을 최대한 유지하면서도 학습 비용을 줄이기 위해 가장 정보량이 많고 대표성 있는 데이터 부분집합을 골라내는 기술이다. 데이터 효율적 학습의 핵심 요소이다.
- 학습 동역학(Training Dynamics)
- — 모델이 학습되는 과정에서 특정 데이터 샘플에 대해 보이는 예측값의 변화나 손실값의 추이를 분석하는 기법이다. 이를 통해 개별 데이터가 학습에 기여하는 난이도나 중요도를 파악할 수 있다.
- 의사 라벨(Pseudo-label)
- — 정답 라벨이 없는 데이터에 대해 클러스터링이나 모델의 예측값을 바탕으로 임시로 부여한 라벨이다. 라벨이 없는 환경에서 지도 학습 알고리즘을 적용하기 위한 가이드 역할을 한다.
- AUM(AUM (Area Under the Margin))
- — 학습 과정 중 모델이 정답 클래스와 가장 높은 확률을 가진 오답 클래스 사이에서 보이는 확신도 차이를 누적한 지표이다. 데이터의 학습 난이도를 정량화하는 데 사용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 06.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.