데이터 누수
학습 데이터와 검증(또는 테스트) 데이터 사이에 동일하거나 강하게 상관된 정보가 포함되어 모델 성능이 부풀려지는 현상으로, 본문에서는 train/test 분할 검증 과정에서 동일 매치업이 양측에 중복되어 초기 정확도를 왜곡했다가 이를 제거하자 오히려 성능이 개선된 사례가 보고됐다.