본문으로 건너뛰기
CodeEmporium조회 3

컴퓨터 비전의 역사를 바꾼 10가지 핵심 논문

LeNet, AlexNet, ResNet, YOLO, U-Net, ViT, CLIP, DINOv2, SAM, Stable Diffusion 등 컴퓨터 비전의 발전을 이끈 10가지 핵심 논문을 정리한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

컴퓨터 비전 분야의 발전을 이끈 10가지 핵심 논문을 통해 초기 CNN 구조부터 현대의 파운데이션 모델까지의 흐름을 짚어본다. LeNet과 AlexNet이 CNN의 기초를 다졌고, ResNet과 U-Net이 구조적 한계를 극복하며 성능을 비약적으로 향상시켰다. 이후 YOLO는 실시간 객체 탐지를, ViT는 트랜스포머 아키텍처를 비전 분야에 성공적으로 도입했다. CLIP, DINOv2, SAM, Stable Diffusion으로 이어지는 최근의 파운데이션 모델들은 제로샷 학습과 고해상도 이미지 생성 등 비전 AI의 새로운 가능성을 열었다.

챕터별 상세

00:00

LeNet

LeNet-5는 현대 컨볼루션 신경망의 시초로, 컨볼루션, 서브샘플링, 완전 연결 계층을 결합해 숫자 분류 문제를 해결했다. 컨볼루션 연산은 이미지의 이동 불변성을 보장하며, 서브샘플링은 위치 변화에 강건한 특징을 추출한다.

컨볼루션 신경망(CNN)은 이미지의 공간적 계층 구조를 학습하는 신경망이다.

02:13

AlexNet

AlexNet은 2012년 ImageNet 대회에서 우승하며 딥러닝의 가능성을 증명했다. ReLU 활성화 함수와 GPU 병렬 처리를 도입해 깊은 신경망 학습을 가능하게 했다.
03:03

ResNet

ResNet은 깊은 신경망에서 발생하는 성능 저하 문제를 스킵 커넥션(skip connection)으로 해결했다. 그래디언트가 초기 계층까지 쉽게 전달되도록 하여 네트워크를 매우 깊게 쌓을 수 있게 되었다.

스킵 커넥션은 신경망의 이전 계층 출력을 다음 계층에 직접 더해주는 구조이다.

04:20

U-Net

U-Net은 생체 의학 이미지 분할을 위해 설계된 구조로, 컨볼루션과 업샘플링 경로를 결합했다. 스킵 커넥션을 통해 깊은 문맥 정보와 공간 정보를 결합하여 정밀한 분할 마스크를 생성한다.

이미지 분할은 이미지 내의 각 픽셀이 어떤 객체에 속하는지 분류하는 작업이다.

06:23

YOLO

YOLO는 이미지를 한 번만 통과시켜 객체 탐지를 수행하는 실시간 탐지 모델이다. 이미지를 그리드로 나누고 각 그리드 셀에서 객체 존재 확률과 경계 상자를 직접 예측한다.
08:38

Vision Transformers

Vision Transformer(ViT)는 이미지를 패치 단위로 분할하여 트랜스포머 인코더에 입력한다. 대규모 데이터셋으로 사전 학습 시 기존 CNN 기반 모델을 능가하는 성능을 보였다.
10:00

CLIP

CLIP은 이미지와 텍스트를 동일한 임베딩 공간에 매핑하여 학습한다. 자연어 감독을 통해 제로샷 분류가 가능하며, 이미지 검색 등 다양한 응용 분야에서 강력한 성능을 발휘한다.

제로샷 학습은 모델이 학습 과정에서 보지 못한 새로운 클래스에 대해서도 추론을 수행하는 능력이다.

11:39

DINOv2

DINOv2는 자기 지도 학습을 통해 강력한 시각 특징을 추출하는 파운데이션 모델이다. 1억 4천만 개의 큐레이션된 데이터를 사용하여 객체 분할 등 다양한 비전 작업에 즉시 활용 가능하다.
13:10

SAM

Segment Anything Model(SAM)은 프롬프트 기반의 범용 이미지 분할 모델이다. 점, 상자, 텍스트 등 다양한 프롬프트를 입력받아 정밀한 마스크를 생성하며, 대규모 데이터셋으로 학습되어 일반화 성능이 뛰어나다.
15:01

Stable Diffusion

Stable Diffusion은 잠재 공간(latent space)에서 확산 과정을 수행하는 생성 모델이다. 픽셀 공간이 아닌 압축된 잠재 공간에서 연산을 수행해 계산 효율성을 높였으며, 텍스트 조건부 이미지 생성을 가능하게 했다.

잠재 확산 모델은 고차원 이미지 공간 대신 저차원의 잠재 공간에서 확산 과정을 수행하는 생성 모델이다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 20.수집 2026. 07. 20.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.