본문으로 건너뛰기

Rainbow DQN의 Noisy Nets 평가 시 결정론적 방식의 함정

Rainbow DQN 학습 시 Noisy Nets의 sigma 값이 정책의 필수 요소로 작동하여, 결정론적 평가보다 확률적 평가가 실제 성능을 더 정확히 반영함을 확인했다.

실용적 조언

  • Noisy Nets를 사용한 에이전트 평가 시, 결정론적 평가와 확률적 평가를 병행하여 실제 정책 성능을 확인하라.

섹션별 상세

01
작성자는 Rainbow DQN(C51, Dueling, Noisy Nets 조합)으로 Snake 게임을 학습시킨 후, 노이즈를 끈 결정론적 평가(Deterministic eval)에서 성능이 불안정한 현상을 발견했다. 450K 에피소드 지점에서 성능이 0점 근처(25%)와 80점 이상(75%)으로 갈리는 이중 모드 분포가 나타났다. 이는 결정론적 정책이 Q-값이 유사한 행동 사이에서 루프에 빠지는 함정에 기인한다.
02
반면, 노이즈를 켠 확률적 평가(Stochastic eval)에서는 이중 모드 실패 모드가 완전히 사라졌다. p25 점수는 2에서 59로, 평균은 59에서 73으로 상승했으며 표준편차는 42에서 26으로 감소했다. 이는 Noisy Nets의 sigma 값이 단순히 탐색용이 아니라, 학습된 정책의 일부로서 결정론적 함정을 회피하는 기능을 수행함을 시사한다.
03
Snake와 같이 한 번의 실수가 치명적인 환경에서는 결정론적 평가가 실제 성능을 왜곡할 수 있다. 작성자는 Noisy Nets를 사용할 경우 결정론적 평가가 항상 정답은 아니며, 노이즈가 과도하게 커지기 전까지는 확률적 평가가 더 정확한 성능 지표가 될 수 있다고 결론지었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 17.수집 2026. 05. 17.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.