TL;DR
파운데이션 모델은 대규모 데이터셋으로 사전 학습되어 다양한 범용 작업에 재사용 가능한 모델을 의미한다. 주로 Transformer 아키텍처를 기반으로 하며 대규모 파라미터와 weakly labeled 데이터셋을 활용한다. BERT와 GPT는 언어 이해 및 생성에, CLIP은 텍스트-이미지 정렬에, DINOv2와 SAM은 시각적 표현 및 분할에, Stable Diffusion은 잠재 공간에서의 이미지 생성에 특화되어 있다. 이러한 모델들은 프롬프팅이나 최소한의 파인튜닝만으로도 광범위한 하위 작업에 적용 가능하다는 공통적인 특징을 가진다.
챕터별 상세
파운데이션 모델의 정의
BERT의 파운데이션 모델로서의 역할
GPT의 파운데이션 모델로서의 역할
CLIP의 파운데이션 모델로서의 역할
DINOv2의 파운데이션 모델로서의 역할
SAM의 파운데이션 모델로서의 역할
Stable Diffusion의 파운데이션 모델로서의 역할
결론
용어 해설
- Foundation Model
- — 대규모 데이터셋으로 사전 학습되어 다양한 범용 작업에 재사용 가능한 AI 모델이다. 주로 Transformer 아키텍처를 기반으로 하며, 프롬프팅이나 최소한의 파인튜닝만으로 광범위한 하위 작업에 적용할 수 있는 범용성이 핵심이다.
- Contrastive Learning
- — 데이터 쌍(예: 이미지와 텍스트) 간의 유사도를 극대화하고, 서로 다른 데이터 간의 거리를 멀게 하여 표현을 학습하는 기법이다. CLIP 모델이 이미지와 텍스트를 동일한 잠재 공간에 정렬하기 위해 사용한다.
- Self-Distillation
- — 모델이 스스로의 지식을 학습하는 기법으로, DINOv2에서 사용된다. 학생 모델이 교사 모델의 출력을 모방하도록 학습하며, 레이블이 없는 데이터에서도 시각적 표현을 효과적으로 추출한다.
- Latent Diffusion
- — 이미지 생성 과정을 픽셀 공간이 아닌 압축된 잠재 공간에서 수행하는 확산 모델이다. 연산 비용을 획기적으로 줄이면서도 고품질의 이미지를 생성할 수 있다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




