TL;DR
컴퓨터 비전은 이미지를 수치 행렬로 변환하여 기계가 자연 세계를 이해하도록 돕는 기술이다. 초기 생물학적 영감에서 시작해 수작업 특징 추출기를 거쳐, 현재는 CNN과 트랜스포머 기반의 거대 모델이 주류를 이룬다. 특히 비전-언어 모델은 이미지와 텍스트를 결합하여 추론 능력을 극대화하며, 자율주행과 의료 영상 등 다양한 분야에 적용되고 있다. 다만 일반화, 견고성, 편향성 및 윤리적 문제는 여전히 해결해야 할 과제로 남아 있다.
챕터별 상세
컴퓨터 비전 개요 및 데이터 표현
주요 컴퓨터 비전 작업
컴퓨터 비전의 역사적 발전
딥러닝과 합성곱 신경망(CNN)
AlexNet과 ResNet의 혁신
비전 트랜스포머(ViT)와 어텐션
f(w, x) = 1 / (1 + e^(-(w0*x0 + w1*x1 + w2)))뉴런의 활성화 함수(시그모이드)를 나타내는 수식으로, 입력값의 가중합을 비선형 변환한다.
파운데이션 모델과 비전-언어 모델
현대적 응용 분야 및 윤리적 과제
용어 해설
- 합성곱 신경망(Convolutional Neural Networks (CNNs))
- — 이미지 데이터를 처리하기 위해 설계된 신경망 구조이다. 필터(커널)를 이미지 위로 슬라이딩하며 지역적 특징을 추출하고, 이를 계층적으로 쌓아 복잡한 패턴을 인식한다. 매개변수 효율성이 높고 이동 불변성을 갖추어 컴퓨터 비전의 핵심 아키텍처로 자리 잡았다.
- 비전 트랜스포머(Vision Transformers (ViTs))
- — 이미지를 패치 단위로 나누어 트랜스포머 아키텍처에 입력하는 모델이다. 어텐션 메커니즘을 통해 이미지 전체의 전역적 문맥을 파악하며, CNN보다 확장성이 뛰어나 대규모 데이터셋 학습에 유리하다.
- 비전-언어 모델(Vision-Language Models (VLMs))
- — 이미지와 텍스트를 동시에 처리하는 멀티모달 모델이다. 비전 인코더를 통해 이미지를 토큰화하고 텍스트와 동일한 임베딩 공간에서 처리하여, 이미지 캡셔닝이나 시각적 질의응답 등 복합적인 추론을 수행한다.
- 수용 영역(Receptive Field)
- — 특정 뉴런이나 필터가 입력 이미지에서 볼 수 있는 영역의 크기이다. 초기 층은 작은 지역적 특징만 보지만, 층이 깊어질수록 수용 영역이 커져 이미지의 더 넓은 문맥을 파악하게 된다.
- 기울기 소실(Vanishing Gradients)
- — 심층 신경망 학습 시 역전파 과정에서 신호가 층을 거치며 0에 가깝게 작아지는 현상이다. 이로 인해 초기 층의 가중치가 거의 업데이트되지 않아 학습이 정체되는데, ResNet의 잔차 연결(Residual Connection)이 이를 해결했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




