TL;DR
DETR 기반 객체 탐지 모델은 헝가리안 매칭 방식의 희소한 지도 학습으로 인해 학습 수렴이 느린 문제가 있다. DEIM 프레임워크는 MixUp과 Mosaic 데이터 증강을 활용하여 Dense One-to-One 매칭을 생성함으로써 학습 중 더 많은 객체 쿼리에 지도 신호를 제공한다. 또한, Matchability-Aware Loss를 도입하여 저품질 매칭의 분류 성능을 보완함으로써 학습 수렴 속도와 정확도를 동시에 개선한다.
챕터별 상세
Transformers 및 Vision Transformers 배경
DETR (Detection Transformer) 분석
RT-DETR 및 D-FINE
DEIM 프레임워크 소개
요약
용어 해설
- Bipartite Matching
- — 두 집합 사이의 최적 대응을 찾는 알고리즘으로, DETR에서는 예측된 객체 쿼리와 실제 객체(Ground Truth)를 1:1로 연결하는 데 사용된다. 이 과정에서 학습이 느려지는 병목이 발생할 수 있다.
- MixUp
- — 두 개의 이미지를 가중치에 따라 섞어 새로운 학습 데이터를 생성하는 증강 기법이다. 모델의 일반화 성능을 높이고 데이터의 다양성을 확보하는 데 기여한다.
- Mosaic
- — 네 개의 이미지를 하나의 이미지로 결합하여 학습시키는 데이터 증강 기법이다. 객체 탐지 모델이 다양한 크기와 위치의 객체를 학습하도록 돕는다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

