챕터별 상세
솔루션 요약 및 배경
Kaggle 그랜드마스터 Patrick Yam이 Jane Street 경진대회 우승 솔루션을 발표했다. 주요 전략은 Modified Axial Transformer 모델 사용, 시간 관련 특성 추가, 고정 에포크 기반의 Seed Averaging, 하이퍼파라미터 튜닝을 포함한 온라인 학습, 그리고 병렬 추론을 위한 인퍼런스 모듈 재작성이다. 금융 데이터의 특성인 Fat-tailed distribution과 Non-stationary 특성을 극복하는 데 초점을 맞췄다.
특성 공학 및 데이터 전처리
기존의 모든 특성을 유지하면서 시간 관련 특성인 Time of Day(TOD)를 추가했다. TOD는 0에서 1 사이의 값으로 리스케일링한 후 Gaussian distribution으로 변환하여 모델이 시간적 맥락을 더 잘 이해하도록 설계했다. 수치형 데이터에 대해서는 극단값을 제거하기 위한 Clipping과 단순 표준화를 적용했으며, 범주형 데이터는 Embedding 레이어를 통해 수치화했다.
Modified Axial Transformer 아키텍처
모델은 자산 간 상호작용을 학습하는 Assets Mixer와 시간적 정보를 처리하는 Time Series Mixer로 구성된다. Axial Attention 구조를 변형하여 시계열 축의 Self-attention을 GRU 레이어로 교체했다. 이는 시계열의 순차적 특성을 더 효율적으로 포착하기 위함이다. Assets Mixer에서는 Self-attention, Mean, Median 풀링 등을 선택적으로 사용할 수 있으며, 최종적으로 Fully Connected 레이어를 통해 예측값을 출력한다.
Axial Attention은 2D 데이터를 처리할 때 행과 열 방향으로 나누어 어텐션을 수행함으로써 연산 복잡도를 줄이는 기법이다.
학습 전략 및 손실 함수 설계
Multi-task learning을 적용하여 메인 타겟 외에도 여러 타겟을 동시에 학습했다. 각 타겟의 가중치는 메인 타겟과의 상관관계에 따라 설정했으며, ChatGPT를 활용해 가중치 조합을 최적화했다. 손실 함수는 경진대회 평가 지표인 R-squared를 직접 최적화하도록 설계했다. 타겟마다 손실 값의 스케일이 다르기 때문에 각 타겟의 손실을 해당 시점의 손실 값으로 나누어 정규화하는 기법을 사용했다.
온라인 학습 및 검증 방법론
금융 데이터의 시간에 따른 변화에 대응하기 위해 매일 새로운 데이터로 모델을 3단계씩 업데이트하는 온라인 학습을 수행했다. Adam 옵티마이저를 사용했으며, Optuna로 튜닝된 Beta1=0.8, Beta2=0.95 파라미터를 적용했다. 실험 결과 온라인 학습을 적용했을 때 적용하지 않았을 때보다 성능이 약 1% 향상되었으며, 이는 금융 도메인에서 매우 큰 차이이다. 검증 시에는 실제 리더보드 환경과 유사하게 시계열 순서를 유지하며 테스트했다.
추론 최적화: Fast Model Inference
9시간이라는 엄격한 추론 시간 제한을 지키기 위해 병렬 추론 모듈을 구현했다. 17개의 서로 다른 시드 모델 가중치를 하나로 쌓고(Stack), PyTorch의 `nn.Linear` 대신 `torch.einsum`을 사용하여 여러 모델의 추론을 한 번에 처리했다. 또한 GRU의 마지막 Hidden state를 캐싱하여 매번 처음부터 계산하지 않도록 최적화했다. 그 결과 17개 모델의 앙상블과 온라인 학습을 포함하고도 2.5시간 만에 추론을 완료했다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 21.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.