본문으로 건너뛰기

비트코인 RL 에이전트 NASMU의 2020-2026 백테스트 성공 사례 및 학습 분석

PPO와 xLSTM 기반의 강화학습 에이전트 NASMU가 비트코인 백테스트에서 고수익을 달성하며, 시장 예측보다 리스크 노출 측정의 중요성을 입증했다.

실용적 조언

  • 암호화폐 트레이딩 모델 설계 시 정규 분포를 가정하는 지표보다 실제 발생한 최악의 손실을 측정하는 CVaR를 활용하라.
  • 허스트 지수(Hurst Exponent)를 계산할 때는 단순 수익률이 아닌 로그 가격 데이터를 사용해야 정확한 시장의 추세 지속성을 파악할 수 있다.
  • PPO 학습이 정체될 경우 하이퍼파라미터를 바꾸기보다 보상 함수(Reward Function)의 구조적 결함이 없는지 먼저 점검하라.

섹션별 상세

01
작성자는 PPO 알고리즘과 4개 블록의 xLSTM 아키텍처를 사용하여 BTC/USDT 4시간 봉 데이터를 학습시켰다. 입력 피처로는 López de Prado 등 유명 금융 공학자들의 이론에서 추출한 35개의 지표를 사용했으며, HMM을 통해 시장 국면을 상승, 하락, 횡보로 구분하여 감지하도록 설계했다. 이를 통해 단순한 가격 예측이 아닌 시장 상황에 따른 유연한 대응 체계를 구축했다.
02
2020년부터 2026년까지의 백테스트 결과, 1만 달러의 초기 자본이 약 280만 달러로 증가하며 28,565%의 총수익률을 기록했다. 샤프 지수는 6.937, 최대 낙폭(MaxDD)은 4.87%로 매우 안정적인 수치를 보였으며, 특히 하락장이었던 2022년에도 3.7%의 낮은 낙폭으로 204%의 수익을 냈다. 이는 모델이 극단적인 시장 상황에서도 자산 보호 능력이 뛰어남을 수치로 증명한 것이다.
03
모델의 결정에 대한 기여도 분석 결과, 모델은 시장을 예측하는 대신 자신의 위험 노출도를 측정하는 법을 스스로 학습했다. ATR(변동성), 52주 고점/저점과의 거리, CVaR(꼬리 위험) 등이 모든 시장 국면에서 가장 중요한 피처로 나타났다. 특히 하락장에서는 점프 강도(Jump Intensity)가 가장 중요한 지표로 부상하며 급격한 가격 변동에 대비하는 모습을 보였다.
04
20번의 시행착오를 통해 순환 신경망인 LSTM의 불안정성은 데이터 증설만으로 해결되지 않으며 보상 설계의 중요성이 크다는 점을 확인했다. PPO의 크리틱(Critic) 기아 현상을 해결하기 위해 하이퍼파라미터 튜닝 대신 보상 함수 자체를 재설계하는 방식을 택했다. 또한 로그 가격 기반의 허스트 지수 계산과 켈리 공식보다 CVaR 기반의 리스크 관리가 암호화폐 시장에서 더 효과적임을 발견했다.

용어 해설

근접 정책 최적화(PPO)
강화학습에서 에이전트의 정책 업데이트 시 급격한 변화를 방지하여 학습의 안정성을 높이는 알고리즘이다. 이전 정책과 새 정책 사이의 비율을 일정 범위 내로 제한(clipping)함으로써 안정적인 수렴을 돕는다.
확장형 장단기 메모리(xLSTM)
기존 LSTM의 병렬 처리 한계를 극복하기 위해 지수적 게이팅과 행렬 메모리 구조를 도입한 아키텍처이다. 시계열 데이터에서 긴 문맥을 더 효율적으로 기억하고 처리할 수 있어 금융 데이터 분석에 유리하다.
조건부 가치 위험(CVaR)
특정 신뢰 수준에서 발생할 수 있는 최악의 손실 평균을 측정하는 리스크 관리 지표이다. 정규 분포를 가정하지 않고 꼬리 위험(Tail Risk)을 직접 측정하므로 변동성이 큰 자산의 위험 관리에 필수적이다.
트리플 배리어 레이블링(Triple Barrier Labeling)
금융 시계열 데이터에서 이익 실현, 손절매, 시간 제한이라는 세 가지 장벽을 설정해 데이터를 분류하는 기법이다. 단순 수익률 기반 레이블링보다 실제 거래 환경의 제약 조건을 더 잘 반영한다.
은닉 마르코프 모델(HMM)
관찰 가능한 데이터를 통해 직접 볼 수 없는 상태(상승, 하락, 횡보 등)를 확률적으로 추론하는 통계 모델이다. 시장의 국면(Regime) 변화를 감지하여 에이전트가 상황에 맞는 전략을 선택하도록 돕는다.

언급된 도구

PPO추천

강화학습 정책 최적화 알고리즘

xLSTM추천

시계열 데이터 처리를 위한 신경망 아키텍처

HMM추천

시장 국면(Regime) 감지

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 10.수집 2026. 04. 10.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.