TL;DR
딥러닝 아키텍처의 진화는 이미지의 공간적 특징을 추출하는 합성곱 신경망(CNN)에서 시작하여, 전역적 문맥을 포착하는 트랜스포머(Transformer) 구조로 전환되었다. 트랜스포머는 병렬 처리 능력을 바탕으로 대규모 데이터 학습을 가능하게 했으며, 이는 BERT와 GPT 같은 모델의 등장으로 이어졌다. 모델 성능이 컴퓨팅 자원과 데이터 양에 비례하여 향상된다는 스케일링 법칙(Scaling Laws)이 정립되면서, 거대 데이터셋으로 사전 학습된 파운데이션 모델이 다양한 도메인에 적용되는 표준이 되었다. 이러한 흐름은 특정 작업에 국한된 모델에서 범용적인 파운데이션 모델로의 패러다임 변화를 이끌었다.
챕터별 상세
Why Convolution Networks are good with images
CNN은 이미지의 픽셀 간 인접성을 활용하여 패턴을 인식하는 신경망 구조이다.
Transformers
어텐션 메커니즘은 입력 데이터의 각 요소가 다른 요소들과 얼마나 관련이 있는지 가중치를 계산하는 방식이다.
BERT, GPT for Pretraining-Finetuning
사전 학습(Pre-training)은 방대한 데이터로 모델을 먼저 학습시키는 과정이며, 미세 조정(Fine-tuning)은 이를 특정 작업에 맞게 최적화하는 과정이다.
Scaling Laws
스케일링 법칙은 모델의 크기와 데이터, 컴퓨팅 자원 간의 상관관계를 수치화한 법칙이다.
Vision Transformer
ViT는 이미지를 텍스트처럼 토큰화하여 트랜스포머 아키텍처에 적용한 모델이다.
Foundation Models
파운데이션 모델은 다양한 하위 작업에 적용 가능한 범용적인 거대 모델을 의미한다.
Answering the Question
용어 해설
- CNN
- — 이미지의 공간적 특징을 추출하는 신경망 구조이다. 필터를 이미지 위로 이동시키며 지역적 패턴을 학습하는 방식으로, 이미지 처리에 최적화된 귀납적 편향을 가진다.
- Transformer
- — 어텐션 메커니즘을 사용하여 데이터 내의 장거리 의존성을 포착하는 신경망 구조이다. 순차적 처리가 아닌 병렬 처리가 가능하여 대규모 데이터 학습에 효율적이다.
- Scaling Laws
- — 모델 파라미터 수, 데이터 양, 컴퓨팅 자원이 증가함에 따라 모델의 성능이 예측 가능한 방식으로 향상되는 관계를 설명하는 법칙이다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



