본문으로 건너뛰기

이미지 세그멘테이션의 역사와 Segment Anything Model의 등장

전통적인 그래프 기반 방식부터 최신 Foundation Model인 SAM까지, 이미지 세그멘테이션 기술의 발전 과정을 아키텍처 중심으로 정리한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이미지 세그멘테이션은 픽셀 단위로 객체를 구분하는 기술로, 초기 그래프 기반 방식에서 CNN 기반의 FCN, U-Net, DeepLab으로 발전하며 공간 정보 손실 문제를 해결해 왔다. 이후 Mask R-CNN과 MaskFormer가 인스턴스 단위의 정교한 마스킹을 가능하게 했으며, 2023년 등장한 SAM은 11억 개의 마스크로 학습된 Foundation Model로서 프롬프트 기반의 범용적인 세그멘테이션을 실현했다. 이 모델은 고정된 카테고리 없이도 제로샷으로 다양한 객체를 분할할 수 있어 세그멘테이션의 패러다임을 전환했다.

챕터별 상세

00:00

전통적인 세그멘테이션 방식

초기 세그멘테이션은 유사한 픽셀을 영역으로 묶는 방식에 의존했다. Felzenszwalb-Huttenlocher 알고리즘은 모든 픽셀을 그래프의 노드로 간주하고 픽셀 강도 차이를 기반으로 엣지를 연결하여 병합한다. 이 방식은 Superpixel 영역을 생성하여 객체 탐지의 전처리 단계로 활용되었다. 이는 딥러닝 이전 컴퓨터 비전에서 객체 경계를 구분하는 핵심 기법이었다.

그래프 기반 알고리즘은 픽셀 간의 관계를 노드와 엣지로 모델링하여 영역을 분할한다.

00:49

CNN과 FCN의 등장

AlexNet이 2012년 CNN의 부활을 알린 후, 2015년 FCN은 이를 세그멘테이션에 적용했다. FCN은 이미지를 컨볼루션, 활성화, 풀링 레이어를 거쳐 픽셀 단위의 분류 결과로 변환한다. 그러나 FCN 구조상의 병목 현상으로 인해 공간 정보가 손실되어 정밀도가 저하되는 문제가 발생했다. 이는 딥러닝 기반 세그멘테이션이 end-to-end 학습을 가능하게 한 중요한 전환점이었다.

FCN은 기존의 분류용 CNN에서 완전 연결 레이어를 제거하고 컨볼루션 레이어로 대체하여 임의 크기의 입력을 처리한다.

01:54

U-Net과 DeepLab의 공간 정보 보존

FCN의 공간 정보 손실 문제를 해결하기 위해 U-Net과 DeepLab이 개발되었다. U-Net은 스킵 커넥션을 도입하여 초기 레이어의 고해상도 공간 정보를 후기 레이어에 직접 전달한다. DeepLab은 Atrous(dilated) 컨볼루션을 사용하여 커널의 수용 영역을 확장함으로써 해상도 저하 없이 문맥 정보를 확보한다. 이러한 기법들은 픽셀 수준의 정밀도와 경계면 처리를 크게 향상시켰다.

스킵 커넥션과 Atrous 컨볼루션은 세그멘테이션 모델에서 정밀한 객체 경계 추출을 가능하게 하는 핵심 아키텍처이다.

04:05

Mask R-CNN과 MaskFormer의 발전

객체 탐지 기술은 인스턴스 세그멘테이션으로 확장되었다. Mask R-CNN은 RoIAlign을 사용하여 탐지된 객체 영역에서 7x7 텐서를 추출하고 마스크를 생성한다. MaskFormer는 세그멘테이션을 픽셀 단위 분류가 아닌 다중 이진 마스크를 동시에 예측하는 문제로 재정의했다. Mask R-CNN은 개별 객체를 구분하는 인스턴스 세그멘테이션을 가능하게 했고, MaskFormer는 학습 과정을 단순화했다.

인스턴스 세그멘테이션은 단순히 객체 영역을 구분하는 것을 넘어, 동일 클래스의 객체라도 개별적으로 분리하여 마스킹한다.

05:38

Segment Anything Model (SAM)의 혁신

기존 세그멘테이션은 고정된 카테고리 분류에 국한되었다. SAM은 1,100만 장의 이미지와 10억 개의 마스크로 학습된 Foundation Model로, 프롬프트 인코더와 이미지 인코더를 결합한 2-way Transformer Attention 구조를 사용한다. 이 모델은 포인트, 박스, 마스크 프롬프트를 입력받아 클래스에 구애받지 않고 객체를 분할한다. 이는 픽셀 그룹화에서 프롬프트 기반의 범용적인 마스크 생성으로 세그멘테이션의 패러다임을 전환했다.

SAM은 제로샷 학습 능력을 갖춘 Foundation Model로서, 특정 데이터셋에 대한 재학습 없이도 다양한 이미지에서 객체를 분할할 수 있다.

용어 해설

이미지 세그멘테이션(Image Segmentation)
이미지 내의 객체 경계를 픽셀 단위로 구분하여 영역을 나누는 컴퓨터 비전 기술이다. 객체 탐지보다 정밀한 형태 정보를 제공하며, 자율주행이나 의료 영상 분석 등에서 필수적으로 사용된다.
아트루스 컨볼루션(Atrous Convolution)
컨볼루션 커널 내부에 구멍(hole)을 뚫어 수용 영역(receptive field)을 넓히는 기법이다. 파라미터 수를 늘리지 않고도 더 넓은 문맥 정보를 파악할 수 있어 세그멘테이션 모델의 해상도 유지에 유리하다.
스킵 커넥션(Skip Connection)
초기 레이어의 특징 맵 정보를 후기 레이어로 직접 전달하는 구조이다. 딥러닝 모델에서 정보 손실을 방지하고 그래디언트 흐름을 원활하게 하여, 세그멘테이션에서 정밀한 공간 정보를 복원하는 데 핵심적인 역할을 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.