본문으로 건너뛰기

Kaggle JPX 도쿄 증권 거래소 예측 경진대회 우승자 발표: Shoki Sakai의 심플한 접근법

선형 회귀와 핵심 주가 지표만을 활용한 단순하면서도 강력한 모델로 JPX 주가 수익률 예측 대회에서 우승한 Shoki Sakai의 전략을 소개합니다.

챕터별 상세

00:00

발표자 소개 및 경진대회 배경

시즈오카 대학 석사 과정인 Shoki Sakai가 JPX 도쿄 증권 거래소 예측 경진대회 우승 전략을 발표한다. 인지 과학과 어펙티브 컴퓨팅을 전공하며 데이터 분석 경험이 많지 않았음에도 불구하고 단순한 모델로 우승을 차지했다. 이번 경진대회는 약 2,000개 주식의 기대 수익률을 순위화하는 과제를 다루었다.
02:00

모델 개요 및 주요 특성 추출

Scikit-learn의 Linear Regression을 사용한 매우 단순한 모델을 구축했다. 주가 데이터 중 고가와 저가가 가장 중요한 변수임을 확인했다. 학습 시간은 1분 미만으로 매우 효율적이며, 복잡한 앙상블 기법보다 안정적인 성능을 보여주었다.
python
from sklearn.linear_model import LinearRegression
from sklearn.preprocessing import StandardScaler

# 데이터 로드 및 결합
# ...(중략)

# 특성 생성
data['Daily_Range'] = data['High'] - data['Low']
data['Mean'] = (data['High'] + data['Low']) / 2

# 표준화
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)

# 모델 학습
model = LinearRegression()
model.fit(X_scaled, y)

Scikit-learn을 사용하여 특성을 생성하고 표준화한 뒤 선형 회귀 모델을 학습시키는 핵심 로직

06:00

특성 공학 및 변수 분석 상세

총 11개의 특성을 사용했으며, 자체적으로 'Daily Range'(고가-저가 차이)와 'Mean'(고가와 저가의 평균)을 추가했다. Partial Dependence Plot 분석 결과, High와 Low는 타겟과 양의 상관관계를, Mean은 음의 상관관계를 보였다. 학습 전 모든 데이터에 대해 StandardScaler를 이용한 표준화를 수행하여 변수 간 척도를 맞추었다.
12:00

학습 방법 및 주요 발견 사항

2017년부터 2022년까지의 데이터를 학습에 사용했으며, COVID-19 전후의 시장 변화를 모두 포함하도록 기간을 설정했다. 복잡한 앙상블 모델보다 단순한 선형 회귀가 더 나은 성능을 보인 이유는 주가의 복잡한 변동 요인을 단순화하여 과적합을 방지했기 때문으로 분석된다. 특히 노이즈가 많은 금융 데이터에서 단순함의 미학이 증명되었다.
18:00

질의응답 및 추가 분석

Random Forest나 Boosting 계열 모델도 시도했으나 선형 회귀보다 유의미한 성능 향상이 없어 최종 모델로 선택했다. 금융 도메인 지식이 부족했기에 오히려 데이터 자체의 핵심 지표에 집중한 것이 주효했다. JPX에서 제공하는 API 활용 가능성과 데이터셋 내 결측치 처리의 어려움 등에 대해 논의하며 발표를 마무리했다.

용어 해설

선형 회귀(Linear Regression)
종속 변수와 하나 이상의 독립 변수 간의 선형 상관관계를 모델링하는 통계학적 기법이다. 금융 데이터 예측에서 모델의 복잡도를 낮추고 과적합을 방지하여 일반화 성능을 높이는 데 효과적이다.
특성 공학(Feature Engineering)
도메인 지식을 활용하여 원시 데이터로부터 머신러닝 알고리즘의 성능을 높일 수 있는 새로운 변수를 생성하거나 선택하는 과정이다. 이 발표에서는 고가와 저가의 차이인 Daily Range 등을 생성하여 모델 성능을 개선했다.
표준화(Standardization)
데이터의 평균을 0, 표준편차를 1로 변환하여 서로 다른 척도를 가진 변수들을 동일한 수준에서 비교할 수 있게 만드는 전처리 기법이다. 선형 회귀 모델에서 각 변수의 영향력을 정확히 평가하기 위해 필수적이다.
부분 의존성 플롯(Partial Dependence Plot)
다른 변수들의 영향을 고정시킨 상태에서 특정 변수가 모델의 예측 결과에 미치는 영향을 시각화하는 도구이다. 변수와 타겟 간의 선형 또는 비선형 관계를 파악하는 데 유용하다.
결정 계수(Coefficient of Determination)
모델이 종속 변수의 변동성을 얼마나 잘 설명하는지를 나타내는 지표로 R-squared라고도 불린다. 1에 가까울수록 모델의 설명력이 높음을 의미하며 회귀 모델의 성능 평가에 주로 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 25.수집 2026. 02. 25.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.