본문으로 건너뛰기
r/computervision조회 4

깊이가 증가할수록 성능이 저하되는 원인과 Residual Network의 최적화 해법

Residual Network는 층이 직접 아이덴티티를 학습하기 어려운 문제를 잔차 학습으로 재구성하여 매우 깊은 네트워크의 최적화를 용이하게 한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

심층 신경망은 층을 깊게 쌓을수록 학습·테스트 성능이 오히려 저하되는 현상이 관찰되며 이 문제는 최적화 난이도에 기인한 underfitting으로 규정된다. 연속된 비선형 블록은 이론적 아이덴티티 f(x)=x를 정확히 학습하기 어렵기 때문에 단순히 층을 더하는 방식으로는 해결이 어렵다. Residual Network는 입력을 직접 전달하는 단축 연결을 도입하여 블록이 잔차를 학습하도록 목표를 바꾸며 잔차를 0으로 만드는 것이 아이덴티티와 동등한 결과를 내도록 설계되어 경사 기반 최적화가 훨씬 수월해진다. 따라서 잔차 구조는 매우 깊은 네트워크에서도 학습 안정성과 성능 유지에 기여한다.

섹션별 상세

01
심층 신경망이 얕은 모델에 비해 학습 및 테스트 성능이 떨어지는 현상이 관찰되며 이 현상은 과적합이 아니라 최적화의 어려움에 따른 underfitting으로 규정되어 있다. 네트워크 깊이가 늘어나면 파라미터 공간과 손실 표면의 복잡성이 증가하여 경사 기반 최적화가 유리한 해를 찾기 어려워진다. 입력에서 출력으로의 직접 전달이 이론적으로 가능함에도 불구하고 실제 학습 과정에서는 성능 저하가 일어난다는 관찰이 실무적 설계 판단에 영향을 미친다.
02
연속된 비선형 블록 예컨대 Conv→ReLU→Conv과 같은 구성은 이론적 아이덴티티 f(x)=x를 구현하려면 각 층의 가중치가 특별히 조정되어야 하므로 gradient descent로 정확한 항등함수를 학습하기가 어렵다. 입력이 그대로 출력으로 이어지는 동작을 만들려면 각 계층이 상쇄되는 복잡한 가중치 조합을 찾아야 하는데 이 과정이 손실 표면과 기울기 정보에 의해 방해받을 수 있다. 이 때문에 단순히 층을 추가하는 방식으로 깊이를 키우면 오히려 학습이 어려워져 성능이 저하될 수 있다.
03
Residual Network는 단축 연결을 통해 블록이 직접 입력을 복원하려는 대신 그 차이 즉 잔차를 학습하도록 목표를 재정의한다. 이 구조에서는 이상적으로 잔차를 0으로 만들면 블록이 아이덴티티처럼 동작하므로 네트워크가 아이덴티티를 구현하기 위해 각 층의 매개변수를 0 쪽으로 이동시키면 되며 이는 경사 기반 최적화에서 훨씬 접근하기 쉬운 목표가 된다. 결과적으로 매우 깊은 네트워크에서도 학습 안정성이 확보되고 최적화 난제가 완화되어 성능이 유지되거나 개선되는 방향으로 작용한다.

용어 해설

잔차 네트워크(Residual Network)
Residual Network는 입력을 출력에 더하는 단축 연결(skip connection)을 삽입하여 각 블록이 입력에 대한 잔차를 학습하게 만드는 구조이다. 잔차 항을 학습하면 네트워크는 복잡한 함수 대신 잔차를 0으로 만드는 식으로 아이덴티티에 가까운 동작을 손쉽게 구현할 수 있다. 이 방식은 매우 깊은 네트워크에서 기울기 소실과 최적화 난제를 완화하여 학습 안정성과 성능 향상을 유도한다.
아이덴티티 매핑(Identity Mapping)
아이덴티티 매핑은 입력을 그대로 출력으로 전달하는 함수 f(x)=x를 의미하며 이론적으로는 깊은 모델이 얕은 모델과 동등한 성능을 확보하게 하는 기준이 된다. 비선형 연속 블록이 정확한 아이덴티티를 구현하려면 매개변수 조합이 특별히 맞아야 하므로 gradient descent 기반 최적화에서 학습이 어렵다. 따라서 아이덴티티를 직접 학습하기보다 잔차를 학습하도록 재구성하는 것이 심층화에서 유리하다.
경사 하강법(Gradient Descent)
Gradient Descent는 손실 함수의 기울기를 따라 매개변수를 갱신하여 최적점을 찾는 반복적 최적화 알고리즘이다. 비선형 계층이 많은 네트워크에서는 손실 표면이 복잡해져 전역 또는 유리한 지역 최적점에 안정적으로 수렴하지 못하는 경우가 발생한다. 이 글에서는 경사 하강법이 아이덴티티 함수를 정확히 학습하기 어려워 깊은 모델에서 underfitting 현상을 유발한다고 보고 있다.
합성곱층(Convolutional Layer)
Convolutional Layer는 입력 이미지의 공간적 패턴을 지역 필터로 추출하는 연산층으로서 여러 층을 쌓아 특징을 점진적으로 추상화한다. 연속된 Conv→ReLU→Conv 식의 비선형 블록은 입력을 그대로 전달하는 아이덴티티를 근사하기 어렵게 만들어 최적화 난제를 심화시킬 수 있다. 따라서 합성곱 블록의 구성 방식과 연결 패턴이 매우 깊은 네트워크의 학습 가능성에 직접적인 영향을 준다.
ReLU 활성함수(ReLU)
ReLU(Rectified Linear Unit)는 음수 영역을 0으로, 양수는 그대로 통과시키는 비선형 활성함수로서 간단한 형태로 기울기 소실 문제를 일부 완화한다. 그러나 ReLU를 포함한 비선형 블록들이 연속될 경우 정확한 항등 함수를 구현하려면 각 층의 출력 분포와 가중치가 정교하게 맞아야 하므로 학습 난이도가 증가한다. 본문은 Conv→ReLU→Conv와 같은 구성에서 아이덴티티 학습이 어렵다는 점을 사례로 제시하고 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 20.수집 2026. 07. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.