본문으로 건너뛰기

LightGBM 분위수 회귀에서의 타겟 인코딩 누수 문제와 어블레이션 분석

LightGBM 분위수 회귀 모델에서 타겟 인코딩이 학습 데이터의 노이즈를 과적합하여 실제 테스트 성능을 저하시키는 현상을 어블레이션 테스트로 확인했다.

섹션별 상세

LightGBM의 분위수 회귀 모델에서 타겟 인코딩이 학습 시에는 중요도 1위를 기록했으나, 실제 테스트 셋에서는 MAPE가 0.28pp 악화되는 성능 저하가 발생했다.
이 현상은 모델이 타겟 인코딩을 통해 학습한 신호가 실제로는 관측 불가능한 변수(판매자 행동, 상품 상태 등)에 의한 노이즈였기 때문에 발생했다.
4-seed × 3-variant 어블레이션 테스트 결과, 변수 간 차이가 표준 편차의 7배에 달하는 등 일반화 실패가 명확히 확인되었다.
작성자는 이러한 타겟 인코딩 누수(leakage) 문제를 해결하기 위해 아키텍처와 어블레이션 방법론을 재설계했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 02.수집 2026. 06. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.