본문으로 건너뛰기

Enefit - 프로슈머 에너지 행동 예측 경진대회 1위 솔루션

XGBoost와 GRU 앙상블, 600개의 피처 엔지니어링, 그리고 온라인 학습 전략을 통해 에스토니아 에너지 시장의 프로슈머 전력량을 정밀하게 예측한 1위 솔루션이다.

챕터별 상세

00:00

1위 솔루션 개요 및 모델 구성

최종 모델은 XGBoost와 GRU의 앙상블로 구성되었으며 각각 0.65와 0.35의 가중치를 적용했다. 모든 모델은 동일한 600개의 피처를 공유하며 온라인 학습과 다중 타겟 학습이 최종 성능 향상에 결정적인 역할을 했다. 단일 모델 성능은 XGBoost가 GRU보다 월등히 우수했으나 두 모델을 결합했을 때 오프라인 CV 40.67, 온라인 리더보드 52.30의 최고 점수를 기록했다. 온라인 학습 적용 시 리더보드 점수가 1.18점 상승하여 순위 결정에 핵심적인 기여를 했다.

앙상블 기법은 서로 다른 특성을 가진 모델들을 결합하여 개별 모델의 편향을 줄이고 예측 안정성을 높이는 방법이다.

01:39

피처 엔지니어링 및 선택 전략

가스 데이터프레임을 제외한 모든 가용 테이블을 병합하여 사용했다. 시간 관련 피처(시간, 월, 요일, 공휴일 여부), 롤링 피처, 일일 통계량, 타임스탬프별 통계량, 그리고 과거 타겟 피처를 포함하여 총 600개의 피처를 생성했다. 초기에는 약 5,000개의 피처를 생성했으나 메모리 부족 문제를 방지하고 모델 실행 속도를 높이기 위해 XGBoost의 피처 중요도 기준 상위 600개만을 선별했다. 검증 전략은 첫 500일 데이터를 학습에 사용하고 나머지 기간을 홀드아웃 세트로 구성하여 리더보드 점수와 높은 상관관계를 유지했다.

롤링 피처(Rolling Features)는 특정 시간 윈도우 내의 평균이나 합계 등을 계산하여 시계열의 추세를 반영하는 변수이다.

03:30

모델 학습 상세: XGBoost와 GRU

XGBoost는 하이퍼파라미터 튜닝보다 피처 그룹별 성능 기여도를 확인하며 피처를 정제하는 데 집중했다. GRU 모델의 입력 텐서는 (배치 크기, 24시간, 600개 피처) 구조로 설계되었으며 2개 층의 양방향 GRU를 사용했다. Transformer 구조도 시도했으나 인코더 레이어만 사용했을 때 결과가 더 나빠져 최종 앙상블에서는 제외했다. 신경망 모델(NN) 도입을 통해 전체 CV 점수를 0.9점 개선하는 효과를 거두었다.

양방향 GRU(Bidirectional GRU)는 시계열 데이터를 정방향과 역방향 모두에서 처리하여 문맥 정보를 더 풍부하게 추출하는 구조이다.

05:09

성능 향상을 위한 핵심 트릭: 온라인 학습과 멀티 타겟

최신 데이터의 중요성을 반영하기 위해 30일 주기로 모델을 총 3회 재학습하는 온라인 학습 전략을 수립했다. 온라인 학습을 적용하지 않았을 경우 3위에 그쳤을 것이나 이를 통해 1위를 확정 지었다. 또한 두 가지 타겟(설치 용량 대비 타겟값, 특정 시점 차이 대비 설치 용량 비율)을 동시에 학습하는 멀티 타겟 방식을 도입했다. 이 두 타겟에 대한 예측값을 가중 앙상블하여 검증 점수를 0.3점 추가로 개선했다.

설치 용량(Installed Capacity)은 프로슈머가 생산할 수 있는 최대 전력량으로 타겟값을 정규화하는 데 중요한 기준이 된다.

용어 해설

프로슈머(Prosumer)
에너지를 소비(Consume)하는 동시에 스스로 생산(Produce)하여 그리드에 공급하는 주체이다. 태양광 패널을 설치한 가계나 기업이 대표적이며 이들의 에너지 행동 예측은 전력망 안정화에 필수적이다.
온라인 학습(Online Learning)
데이터가 실시간으로 유입될 때마다 또는 특정 주기마다 모델을 지속적으로 업데이트하는 기법이다. 시계열 예측에서 최신 데이터의 경향성을 즉각 반영하여 예측 오차를 줄이는 데 중요한 역할을 한다.
다중 타겟 학습(Multi-target Learning)
하나의 모델이 두 개 이상의 서로 연관된 목표 변수를 동시에 예측하도록 학습시키는 방법이다. 변수 간의 상관관계를 모델이 학습 과정에서 활용함으로써 단일 타겟 예측보다 일반화 성능이 향상되는 효과가 있다.
피처 중요도(Feature Importance)
모델이 예측을 수행할 때 각 입력 변수가 결과에 기여하는 정도를 수치화한 지표이다. 수천 개의 변수 중 예측 성능에 실질적 영향을 주는 핵심 변수를 선별하는 변수 선택 과정의 근거로 활용된다.
게이트 순환 유닛(GRU)
RNN의 기울기 소실 문제를 해결하기 위해 고안된 구조로 LSTM보다 구조가 단순하면서도 시계열 데이터의 장기 의존성을 잘 학습한다. 업데이트 게이트와 리셋 게이트를 통해 정보의 흐름을 조절한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 26.수집 2026. 02. 26.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.