TL;DR
API 모니터링에서 전통적인 평균 지연 시간 기반 탐지는 사소한 이상 징후를 놓치기 쉽다. JP Morgan은 모든 API 요청을 단기 실행 그래프(DAG)로 모델링하여, 요청이 통과하는 미들웨어 단계를 실시간으로 추적하고 학습한다. 실제 실행 경로를 학습된 그래프와 비교함으로써, 생략되거나 순서가 바뀐 단계를 즉각 식별하고 지연의 근본 원인을 특정 노드 단위로 30초 이내에 찾아낸다. 또한, 단순 이상치와 드리프트를 구분하고 드리프트를 구조적, 볼륨, 공변량 변화로 분류하여, 시스템 변경 시에만 경고를 발생시키는 효율적인 모니터링 체계를 구축한다.
챕터별 상세
Execution graphs for anomaly and drift detection
What a short lived execution graph is
Tiered checks and per client baselines
The method: baseline, deviation, localize, act
Localizing a slow node, and how the system is trained
Anomaly versus drift
The three kinds of drift: structural, volume, covariate
The pipeline: from telemetry to gradual rollout
Hot path versus recon, and worked examples
Tuning it: delayed events, sampling, cold starts
Results and lessons
용어 해설
- 방향성 비순환 그래프(DAG)
- — 노드 간의 방향성 있는 관계를 나타내는 자료구조로, API 요청의 처리 단계를 순서대로 모델링하는 데 사용됨. 순환이 없는 구조를 통해 요청의 실행 흐름을 명확하게 파악할 수 있음.
- 쿨백-라이블러 발산(KL Divergence)
- — 두 확률 분포 간의 차이를 측정하는 지표로, API 요청 패턴의 드리프트를 탐지할 때 기준 분포와 현재 분포의 변화를 정량화하는 데 사용됨.
- 원격 측정(Telemetry)
- — 시스템의 상태와 성능 데이터를 실시간으로 수집하는 기술로, API 요청의 실행 경로와 지연 시간을 추적하여 이상 탐지의 기반 데이터로 활용됨.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.