TL;DR
Sigmoid의 기울기 소실과 ReLU의 과적합 문제를 해결하기 위해 GELU, SiLU, SwiGLU 같은 현대적 활성화 함수가 등장했다. 이 함수들은 뉴런을 무작위로 끄는 Dropout 기법을 수식 내부에 확률적으로 통합하여 입력값의 크기에 따라 신호 전달 여부를 결정한다. GELU는 가우시안 분포를, SiLU는 Sigmoid를 확률 함수로 사용하며, SwiGLU는 추가 가중치를 통해 형태의 유연성을 극대화했다. 이러한 구조적 개선은 Transformer 기반 모델의 학습 안정성과 예측 성능을 높이는 데 결정적인 역할을 한다.
챕터별 상세
현대적 활성화 함수의 특징과 ReLU와의 차이
활성화 함수는 신경망에서 입력 신호의 합을 출력 신호로 변환하는 비선형 함수이다.
Sigmoid와 ReLU가 딥러닝 학습에서 겪는 한계
기울기 소실은 층이 깊어질수록 역전파되는 미분값이 작아져 학습이 중단되는 현상이다.
Dropout이 과적합을 방지하고 학습을 개선하는 방식
과적합은 모델이 훈련 데이터에만 너무 맞춰져 새로운 데이터에 대한 예측력이 떨어지는 상태이다.
GELU: 입력값에 의존하는 Dropout의 수식화
가우시안 분포는 자연계에서 흔히 발견되는 종 모양의 확률 분포로, 통계학의 핵심 개념이다.
활성화 함수의 일반 공식과 SiLU의 정의
누적 분포 함수는 확률 변수가 특정 값보다 작거나 같을 확률을 나타내는 함수이다.
ActivationFunction(x) = x * p(x)입력값과 생존 확률의 곱으로 정의되는 활성화 함수의 일반 공식
SwiGLU: 가중치를 추가하여 유연성을 극대화한 구조
게이트 메커니즘은 특정 정보의 통과 여부를 조절하여 신경망의 흐름을 제어하는 구조이다.
용어 해설
- 활성화 함수(Activation Function)
- — 신경망의 뉴런 출력을 결정하는 비선형 함수이다. 입력 신호의 합을 받아 다음 계층으로 전달할 신호의 강도를 조절하며, 모델이 복잡한 패턴을 학습할 수 있게 하는 핵심 요소이다.
- ReLU
- — 입력이 0보다 크면 그대로, 0 이하면 0을 출력하는 함수이다. 계산이 매우 빠르고 기울기 소실 문제를 완화하여 딥러닝 대중화에 기여했으나, 0에서 미분 불가능하고 과적합에 취약한 단점이 있다.
- 드롭아웃(Dropout)
- — 학습 중 무작위로 뉴런을 제거하여 과적합을 방지하는 규제 기법이다. 매 단계마다 서로 다른 부분 신경망을 학습시켜 앙상블 효과를 내며, 모델의 일반화 성능을 높이는 데 사용된다.
- 역전파(Backpropagation)
- — 출력값의 오차를 신경망의 역방향으로 전달하여 가중치를 갱신하는 학습 알고리즘이다. 미분의 연쇄 법칙을 사용하여 각 파라미터가 오차에 기여한 정도를 계산하고 최적화한다.
- 기울기 소실(Vanishing Gradient)
- — 신경망의 층이 깊어질수록 역전파되는 미분값이 0에 가까워져 학습이 제대로 이루어지지 않는 현상이다. Sigmoid와 같은 함수에서 입력값이 클 때 미분값이 작아지는 특성 때문에 주로 발생한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

