본문으로 건너뛰기

Bug or Feature: Weight Drift, Activation Sparsity and Spikes

손실 함수와 활성화 함수의 상호작용으로 가중치 드리프트가 발생하고 이로 인해 활성화가 희소해지며, 트랜스포머 계열에서도 예측 품질과 연산 효율성 간의 트레이드오프를 형성한다. 초기 학습 단계의 dynamics가 모델 성능에 큰 영향을 미치고, non-centering normalization이 이 현상을 어떻게 강화하는지 규명한다.

용어 해설

활성화(Activation)
뉴런의 출력 신호를 결정하는 비선형 함수의 출력 여부와 크기를 말한다. 모델의 표현력과 학습 동향에 직접 영향을 준다.
가중치 드리프트(Weight Drift)
학습 초기에 활성화 편향과 손실 함수의 상호작용으로 가중치가 기대값 방향으로 지속적으로 움직이는 현상을 말한다.
생존 조건화(Survival Conditioning)
ReLU 게이트의 활성화 여부가 입력 방향으로의 양의 성분에 따라 달라지면서 활성화 신호가 살아남아 다른 층으로 전달되는 현상을 설명한다.
Accumulation Stop
학습 초기 통계치를 EMA로 축적한 뒤 일정 시점에 고정화해 이후의 계산을 줄이는 기법이다.
백분위 수 중앙화(Percentile Centering)
평균 중심화 대신 활성화 전의 분포에서 특정 percentile로 중심을 이동시켜 일부 신호를 0 근처로 모으는 정규화 방식이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 17.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.