본문으로 건너뛰기
r/deeplearning조회 2

지도 학습의 필연적 기하학적 사각지대: 이론, 결과 및 최소한의 수리 방법

표준 지도 학습(ERM)이 레이블과 상관관계가 있는 노이즈를 강제로 학습하여 기하학적 왜곡을 일으킴을 증명하고, 이를 가우시안 노이즈 기반의 PMH 기법으로 해결하는 방안을 제시했다.

실용적 조언

  • RAG나 RLHF 파이프라인에서 모델의 기하학적 왜곡을 측정하고 싶다면 가중치 접근 없이도 가능한 TDI 지표를 활용하라.
  • 특정 태스크 파인튜닝 시 발생하는 성능 저하나 편향을 막기 위해 가우시안 노이즈 기반의 야코비안 정규화 항을 손실 함수에 추가하는 것을 고려하라.

섹션별 상세

01
ERM(경험적 위험 최소화) 목적 함수 자체가 모델이 레이블과 상관관계가 있는 모든 특징을 인코딩하도록 강제한다는 점이 수학적으로 증명됐다. 연구진은 레이블과 상관관계 ρ를 가진 노이즈 특징이 있을 때, 모델의 야코비안 민감도 하한선이 ρ에 비례하여 항상 양수임을 보였다. 이는 데이터 크기나 모델 용량과 무관하게 발생하는 구조적 문제이며, 모델이 텍스처나 배경 같은 불필요한 정보에 민감해질 수밖에 없는 근본 원인이다.
02
기존의 PGD 적대적 학습이 야코비안 프로베니우스 노름을 12배 감소시키지만, 실제 기하학적 구조(TDI)는 오히려 악화시킨다는 실험 결과가 확인됐다. PGD는 특정 적대적 방향의 민감도를 압축하지만, 이 민감도가 다른 방향으로 재분배되어 야코비안 행렬이 랭크-1에 가까운 비등방성을 띠게 만든다. 결과적으로 등방성 조사를 수행하는 TDI 지표에서 PGD 모델은 1.336을 기록하여 일반 ERM 모델(1.093)보다 나쁜 성적을 보였다.
03
모델의 규모가 커질수록 이러한 기하학적 사각지대 문제가 오히려 심화된다는 사실이 BERT 계열 모델 분석을 통해 나타났다. DistilBERT(66M)에서 0.860이었던 사각지대 비율이 BERT-large(340M)에서는 0.742로 감소하며, 이는 모델 용량이 클수록 레이블과 상관관계가 있는 노이즈 특징을 더 정밀하게 학습하기 때문이다. 규모의 경제가 강건성 문제를 자동으로 해결해주지 못하며 오히려 악화시킬 수 있음을 시사한다.
04
RLHF(인간 피드백 기반 강화학습) 과정에서도 동일한 이론적 결함이 발생하여 모델의 아첨(Sycophancy)이나 길이 편향이 발생한다는 주장이 제기됐다. 선호도 레이블에 포함된 답변 길이, 형식, 자신감 있는 어조 등의 상관관계를 모델이 수학적으로 인코딩할 수밖에 없기 때문이다. 실제 실험에서 SST-2 데이터셋으로 파인튜닝 시 사각지대가 54% 증가했으며, 이는 특정 태스크 학습이 모델의 기하학적 왜곡을 증폭시킴을 의미한다.
05
가우시안 노이즈를 이용한 PMH(Perturbation Magnitude Homogenization) 정규화가 야코비안을 모든 방향에서 균일하게 억제하는 유일한 해법임이 증명됐다. PMH는 손실 함수에 단일 항을 추가하는 것만으로 TDI를 최대 29% 감소시키고, CIFAR-10-C 벤치마크의 19개 부패 유형 중 18개에서 승리하는 성과를 거뒀다. 특히 적대적 학습 없이도 48.94%의 PGD 강건성을 확보하며 연산 오버헤드는 1.3배 수준으로 억제했다.
python
L_PMH = torch.norm(phi(x) - phi(x + delta), p=2)**2 # delta ~ N(0, sigma^2 * I)

가우시안 노이즈를 이용해 야코비안 프로베니우스 노름을 균일하게 억제하는 PMH 손실 함수 구현 예시

용어 해설

경험적 위험 최소화(ERM)
주어진 훈련 데이터셋에 대해 평균 손실을 최소화하는 기계 학습의 표준 최적화 원칙이다. 이 방식은 훈련 데이터 내의 레이블과 상관관계가 있는 모든 특징을 학습하도록 강제하며, 이 과정에서 테스트 시점에 불필요한 노이즈(nuisance) 정보까지 모델이 인코딩하게 만드는 기하학적 사각지대를 형성한다.
야코비안 행렬(Jacobian Matrix)
다변수 함수의 입력 변화에 따른 출력의 변화율을 나타내는 1차 미분 행렬이다. 딥러닝에서는 입력 데이터의 미세한 변화가 모델의 내부 표현이나 출력에 미치는 민감도를 측정하는 데 사용되며, 이 행렬의 특성을 분석하여 모델의 기하학적 안정성과 강건성을 평가할 수 있다.
투영 경사 하강법 학습(PGD Training)
적대적 공격을 방어하기 위해 훈련 과정에서 인위적으로 생성된 적대적 예제를 포함하여 학습하는 기법이다. 특정 방향의 적대적 섭동에는 강해지지만, 야코비안 행렬의 민감도를 특정 방향으로만 압축시켜 오히려 일반적인 입력에 대한 기하학적 왜곡을 심화시킬 수 있다는 한계가 지적된다.
궤적 편차 지수(TDI)
등방성 섭동 하에서 모델의 내부 표현이 얼마나 왜곡되는지를 측정하는 지표이다. 야코비안 행렬의 비등방성을 감지하여, 기존의 프로베니우스 노름이나 CKA가 놓치는 모델의 기하학적 결함을 정확하게 식별하며 모델이 입력의 의미적 변화보다 표면적 변화에 얼마나 민감한지 수치화한다.

언급된 도구

PMH추천링크

야코비안 민감도를 균일하게 억제하여 모델의 기하학적 사각지대를 수리하는 정규화 기법

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 27.수집 2026. 04. 27.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.