챕터별 상세
GPU 하드웨어 아키텍처 복습
HBM(High Bandwidth Memory)은 GPU 외부의 큰 메모리이며, SM 내부의 레지스터와 공유 메모리는 매우 빠르지만 용량이 작다.
GPU 프로그래밍 모델: Thread와 Block
CUDA 프로그래밍의 기본 단위인 Thread와 이들의 묶음인 Block이 어떻게 하드웨어 SM에 할당되는지가 성능의 핵심이다.
성능 저하의 원인: Control Divergence와 Occupancy
Warp는 GPU에서 명령어를 실행하는 최소 단위이며, 모든 Thread가 같은 길을 가야 가장 빠르다.
메모리 최적화: Bank Conflict와 Coalescing
메모리 접근을 '정렬'하여 한 번에 많은 데이터를 가져오는 것이 GPU 성능 최적화의 핵심이다.
벤치마킹과 프로파일링 실습
GPU 연산은 CPU와 비동기로 작동하므로 단순히 CPU 시간을 측정하면 안 된다.
Kernel Fusion의 효과 분석
Kernel Fusion은 여러 연산을 하나의 커널로 합쳐 중간 결과를 메모리에 쓰지 않고 재사용하는 기법이다.
Triton 커널 작성법: GeLU 구현
Triton은 OpenAI에서 만든 GPU 프로그래밍 언어로, Python과 유사한 문법으로 고성능 커널을 작성할 수 있게 해준다.
Tiling 기법과 Matrix Multiplication
Tiling은 큰 문제를 작은 조각으로 나누어 빠른 로컬 메모리에서 해결하는 전략이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
