TL;DR
이미지 세그멘테이션은 픽셀 단위로 객체를 구분하는 기술로, 초기 그래프 기반 방식에서 CNN 기반의 FCN, U-Net, DeepLab으로 발전하며 공간 정보 손실 문제를 해결해 왔다. 이후 Mask R-CNN과 MaskFormer가 인스턴스 단위의 정교한 마스킹을 가능하게 했으며, 2023년 등장한 SAM은 11억 개의 마스크로 학습된 Foundation Model로서 프롬프트 기반의 범용적인 세그멘테이션을 실현했다. 이 모델은 고정된 카테고리 없이도 제로샷으로 다양한 객체를 분할할 수 있어 세그멘테이션의 패러다임을 전환했다.
챕터별 상세
전통적인 세그멘테이션 방식
그래프 기반 알고리즘은 픽셀 간의 관계를 노드와 엣지로 모델링하여 영역을 분할한다.
CNN과 FCN의 등장
FCN은 기존의 분류용 CNN에서 완전 연결 레이어를 제거하고 컨볼루션 레이어로 대체하여 임의 크기의 입력을 처리한다.
U-Net과 DeepLab의 공간 정보 보존
스킵 커넥션과 Atrous 컨볼루션은 세그멘테이션 모델에서 정밀한 객체 경계 추출을 가능하게 하는 핵심 아키텍처이다.
Mask R-CNN과 MaskFormer의 발전
인스턴스 세그멘테이션은 단순히 객체 영역을 구분하는 것을 넘어, 동일 클래스의 객체라도 개별적으로 분리하여 마스킹한다.
Segment Anything Model (SAM)의 혁신
SAM은 제로샷 학습 능력을 갖춘 Foundation Model로서, 특정 데이터셋에 대한 재학습 없이도 다양한 이미지에서 객체를 분할할 수 있다.
용어 해설
- 이미지 세그멘테이션(Image Segmentation)
- — 이미지 내의 객체 경계를 픽셀 단위로 구분하여 영역을 나누는 컴퓨터 비전 기술이다. 객체 탐지보다 정밀한 형태 정보를 제공하며, 자율주행이나 의료 영상 분석 등에서 필수적으로 사용된다.
- 아트루스 컨볼루션(Atrous Convolution)
- — 컨볼루션 커널 내부에 구멍(hole)을 뚫어 수용 영역(receptive field)을 넓히는 기법이다. 파라미터 수를 늘리지 않고도 더 넓은 문맥 정보를 파악할 수 있어 세그멘테이션 모델의 해상도 유지에 유리하다.
- 스킵 커넥션(Skip Connection)
- — 초기 레이어의 특징 맵 정보를 후기 레이어로 직접 전달하는 구조이다. 딥러닝 모델에서 정보 손실을 방지하고 그래디언트 흐름을 원활하게 하여, 세그멘테이션에서 정밀한 공간 정보를 복원하는 데 핵심적인 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

