TL;DR
CNN은 초기 레이어에서 고해상도 세부 정보를, 깊은 레이어에서 넓은 문맥 정보를 추출하는 계층적 구조를 통해 다양한 크기의 객체를 인식한다. LeNet-5와 AlexNet을 거쳐 발전한 아키텍처는 Faster R-CNN, YOLO, U-Net 등으로 확장되며 객체 탐지와 분할 성능을 높였다. 특히 U-Net의 Skip connection과 Feature Pyramid Networks(FPN)는 하위 레이어의 공간 정보와 상위 레이어의 문맥 정보를 결합하여 스케일 불변성을 확보한다. 이러한 기술적 진화는 현대 컴퓨터 비전 모델이 작은 물체부터 큰 물체까지 정밀하게 탐지할 수 있는 핵심 원리이다.
챕터별 상세
CNN의 스케일 인식 원리
CNN의 계층적 구조가 어떻게 다양한 크기의 객체를 인식하는지에 대한 핵심 원리를 다룬다.
LeNet-5의 등장
초기 CNN 모델인 LeNet-5의 구조와 한계를 다룬다.
수동 특징 추출의 시대
딥러닝 이전의 컴퓨터 비전 접근 방식인 Hand-crafted features를 다룬다.
AlexNet의 혁신
현대 딥러닝의 시발점이 된 AlexNet의 주요 기술적 기여를 다룬다.
실시간 객체 탐지: Faster R-CNN
객체 탐지 속도를 획기적으로 개선한 Faster R-CNN의 구조를 다룬다.
YOLO의 단일 패스 탐지
YOLO의 단일 패스 탐지 방식과 효율성을 다룬다.
의미론적 분할과 U-Net
픽셀 단위 분류를 수행하는 U-Net의 구조와 Skip connection의 역할을 다룬다.
Mask R-CNN의 통합
탐지와 분할을 결합한 Mask R-CNN의 아키텍처를 다룬다.
계층적 구조의 역할
CNN 레이어 깊이에 따른 특징 추출의 차이를 다룬다.
Feature Pyramid Networks의 활용
다중 스케일 객체 탐지를 위한 FPN의 작동 원리를 다룬다.
용어 해설
- 합성곱 신경망(CNN)
- — 이미지 처리에 특화된 딥러닝 아키텍처로, 필터를 사용하여 이미지의 공간적 특징을 추출한다. 계층적 구조를 통해 저수준의 세부 특징부터 고수준의 의미론적 정보를 학습한다.
- 스킵 연결(Skip Connection)
- — 네트워크의 이전 레이어 출력을 이후 레이어에 직접 더해주는 구조이다. 정보 손실을 방지하고 기울기 소실 문제를 완화하며, 공간 정보와 문맥 정보를 결합하는 데 사용된다.
- 피처 피라미드 네트워크(Feature Pyramid Networks)
- — 다양한 스케일의 객체를 탐지하기 위해 하향식 경로와 측면 연결을 사용하여 다중 스케일 특징 맵을 생성하는 아키텍처이다. 작은 객체와 큰 객체 모두에 대한 인식 성능을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



