TL;DR
컴퓨터 비전 분야의 발전을 이끈 10가지 핵심 논문을 통해 초기 CNN 구조부터 현대의 파운데이션 모델까지의 흐름을 짚어본다. LeNet과 AlexNet이 CNN의 기초를 다졌고, ResNet과 U-Net이 구조적 한계를 극복하며 성능을 비약적으로 향상시켰다. 이후 YOLO는 실시간 객체 탐지를, ViT는 트랜스포머 아키텍처를 비전 분야에 성공적으로 도입했다. CLIP, DINOv2, SAM, Stable Diffusion으로 이어지는 최근의 파운데이션 모델들은 제로샷 학습과 고해상도 이미지 생성 등 비전 AI의 새로운 가능성을 열었다.
챕터별 상세
LeNet
컨볼루션 신경망(CNN)은 이미지의 공간적 계층 구조를 학습하는 신경망이다.
AlexNet
ResNet
스킵 커넥션은 신경망의 이전 계층 출력을 다음 계층에 직접 더해주는 구조이다.
U-Net
이미지 분할은 이미지 내의 각 픽셀이 어떤 객체에 속하는지 분류하는 작업이다.
YOLO
Vision Transformers
CLIP
제로샷 학습은 모델이 학습 과정에서 보지 못한 새로운 클래스에 대해서도 추론을 수행하는 능력이다.
DINOv2
SAM
Stable Diffusion
잠재 확산 모델은 고차원 이미지 공간 대신 저차원의 잠재 공간에서 확산 과정을 수행하는 생성 모델이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


