TL;DR
Part 1에서 구성한 Snowflake 환경을 Amazon SageMaker Canvas에 연결하면 Data Wrangler에서 데이터를 직접 불러와 노코드 방식으로 사기 탐지용 데이터셋을 만들 수 있습니다. 카드와 가맹점별 평균 및 표준편차로 이상치 임계값을 계산하고 거래 시간, 요일, 인구통계, 사기 이력 같은 파생 특성을 생성한 뒤 두 데이터 소스를 조인합니다. CC_NUM과 가맹점명 등 민감하거나 불필요한 열을 제거하고 Data Quality and Insights Report로 타깃 누수, 클래스 불균형, 특성 중요도와 Quick model 성능을 점검합니다. 준비된 데이터는 2-category 모델과 Ensemble 학습 방식의 XGBoost로 약 15–30분 동안 학습할 수 있으며, 완성된 모델은 보지 않은 CSV에 예측을 생성하고 권한과 Region을 맞춘 뒤 Amazon Quick Sight로 결과를 전송할 수 있습니다.
섹션별 상세












용어 해설
- Data Wrangler
- — Amazon SageMaker Canvas 안에서 데이터를 직접 연결하고 변환하는 시각적 데이터 준비 기능입니다. 사용자는 SQL 또는 내장 변환을 이용해 결측값 처리, 파생 변수 생성, 데이터 결합과 열 삭제를 수행할 수 있습니다. 모델 학습 전에 데이터 품질을 점검하고 준비된 데이터를 모델 생성 단계로 넘기는 역할을 합니다.
- 이상치 임계값(Outlier Threshold)
- — 평균과 표준편차를 이용해 일반적인 거래 금액의 상한선을 계산하는 기준입니다. 글에서는 카드와 거래 범주별 평균 금액에 표준편차의 3배를 더해 임계값을 만들고, 이를 초과한 거래를 이상 거래 후보로 표시합니다. 카드 소유자나 가맹점의 평소 패턴에서 크게 벗어난 금액을 모델 입력 변수로 바꾸는 데 쓰입니다.
- 특성 공학(Feature Engineering)
- — 원시 데이터에서 모델 예측에 사용할 새로운 변수를 계산하고 조합하는 과정입니다. 이 워크플로에서는 거래 시간, 요일, 고객 속성, 가맹점 정보, 카드와 가맹점별 이상치 여부를 파생 변수로 생성합니다. 이렇게 가공한 특성은 사기 거래와 정상 거래를 구분하는 입력으로 활용됩니다.
- 타깃 누수(Target Leakage)
- — 예측 시점에 알 수 없어야 하는 정보가 학습 데이터의 입력 특성에 섞이는 문제입니다. Data Quality and Insights Report는 데이터 준비 과정에서 이러한 문제와 클래스 불균형 같은 품질 이슈를 점검하는 데 사용됩니다. 누수가 남으면 검증 성능이 실제 운영 환경보다 과도하게 높아질 수 있으므로 모델 생성 전에 확인해야 합니다.
- 왼쪽 외부 조인(Left Outer Join)
- — 왼쪽 데이터의 모든 행을 유지하면서 오른쪽 데이터에서 일치하는 열을 결합하는 SQL 조인 방식입니다. Canvas의 Join 변환에서는 두 데이터 흐름을 연결하고 CC_NUM과 CATEGORY 같은 키를 지정해 보강 정보를 붙입니다. 일치하는 오른쪽 행이 없는 경우에도 왼쪽 거래 기록을 보존할 수 있습니다.
기술
- Amazon SageMaker Canvas
- Amazon SageMaker Data Wrangler
- Snowflake
- XGBoost
- Amazon Quick Sight
- AWS IAM
- Amazon S3
활용 사례
- 신용카드 거래 사기 탐지
- Snowflake 기반 거래 데이터 준비
- 노코드 분류 모델 구축
- Amazon Quick Sight를 이용한 예측 결과 시각화
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.