BERT부터 Stable Diffusion까지, 파운데이션 모델의 핵심 작동 원리
대규모 사전 학습을 통해 다양한 작업에 재사용 가능한 파운데이션 모델의 정의와 BERT, CLIP, SAM 등 주요 모델의 작동 원리를 분석한다.
Python을 사용하여 GAN, transformer, LLM 등 ML/DL 개념을 기초부터 구현하며, 코드 중심의 설명과 실무 적용 사례를 다룹니다.
대규모 사전 학습을 통해 다양한 작업에 재사용 가능한 파운데이션 모델의 정의와 BERT, CLIP, SAM 등 주요 모델의 작동 원리를 분석한다.
DEIM은 데이터 증강과 Matchability-Aware Loss를 통해 DETR 기반 모델의 학습 수렴 속도와 정확도를 개선하는 프레임워크이다.
LeNet, AlexNet, ResNet, YOLO, U-Net, ViT, CLIP, DINOv2, SAM, Stable Diffusion 등 컴퓨터 비전의 발전을 이끈 10가지 핵심 논문을 정리한다.
D-FINE은 확률 분포 기반의 바운딩 박스 정제와 자기 증류 기법을 통해 기존 객체 탐지 모델의 속도와 정확도 문제를 해결했다.
CNN의 공간적 특징 추출 능력과 트랜스포머의 확장성을 바탕으로 파운데이션 모델이 발전해 온 AI 아키텍처의 진화 과정을 다룬다.
RNN과 LSTM의 순차적 처리 한계를 극복하고 병렬 연산과 어텐션 메커니즘을 도입한 트랜스포머의 구조적 탄생 배경을 설명한다.
R-CNN부터 YOLOv10까지 객체 탐지 모델의 발전 과정을 살펴보고, 특히 NMS 문제를 해결한 RT-DETR과 YOLOv10의 혁신을 분석합니다.
OpenAI의 DALL-E 모델이 dVAE를 통해 이미지를 토큰화하고 GPT를 사용하여 텍스트와 이미지 토큰을 자기회귀적으로 생성하는 내부 아키텍처와 학습 과정을 상세히 다룹니다.
DALL-E의 이미지 생성 원리를 이해하기 위해 필수적인 오토인코더의 진화 과정(AE, VAE, VQ-VAE)과 수학적 메커니즘을 상세히 분석합니다.
표준 컨볼루션을 Depthwise와 Pointwise 단계로 분리하여 연산량과 파라미터를 획기적으로 줄이는 Depthwise Separable Convolution의 원리와 실전 구현법을 다룹니다.
다양한 크기의 객체를 효과적으로 탐지하기 위해 CNN 아키텍처에 스케일 인지 능력을 더해주는 Feature Pyramid Network의 원리와 구현 방법을 상세히 다룹니다.
Vision Transformer(ViT)의 아키텍처와 CNN과의 차이점, 그리고 대규모 데이터셋에서의 성능 우위를 바탕으로 한 사전 학습 및 파인튜닝 과정을 상세히 다룹니다.
객체 탐지 분야에 Transformer 아키텍처를 도입하여 복잡한 후처리 과정을 제거하고 성능을 극대화한 DETR의 구조와 학습 메커니즘을 상세히 분석합니다.
Swin Transformer는 윈도우 기반 셀프 어텐션과 계층적 구조를 도입하여 기존 Transformer의 연산 효율성 문제를 해결하고 비전 작업 성능을 극대화한 모델이다.
CLIP은 이미지와 텍스트를 동일한 임베딩 공간에 매핑하여 제로샷 분류와 풍부한 시각적 표현 학습을 가능하게 하는 대조 학습 기반 신경망이다.
대형 교사 모델의 지식을 소형 학생 모델로 전수하여 추론 속도를 높이고 정확도 손실을 최소화하는 지식 증류 기법의 역사와 수학적 원리를 다룬다.
Mask R-CNN의 아키텍처를 Faster R-CNN과 비교 분석하고 RoIAlign의 핵심 원리와 마스크 분지를 통한 인스턴스 세그멘테이션 과정을 상세히 설명합니다.