TL;DR
AI 기반 옵저버빌리티 에이전트는 알림, 로그, Trace를 연결해 장애 원인 가설을 빠르게 만들지만, 기존에는 사람이 별도 브라우저에서 대시보드와 Trace를 다시 확인해야 했습니다. Amazon OpenSearch Service의 MCP Apps는 Model Context Protocol 응답에 구조화된 텍스트와 인터랙티브 Trace 워터폴, 서비스 맵, 차트를 함께 담아 IDE의 같은 대화 스레드에 렌더링합니다. 로컬 MCP server가 AWS 자격 증명으로 OpenSearch UI에 질의를 전달하고, 실제 데이터에 기반한 결정적 시각화를 반환하므로 에이전트의 추론과 사람이 확인하는 증거를 한 화면에서 연결합니다. Node.js 22 이상과 es:ESHttpGet 및 es:ESHttpPost 권한을 준비하면 Claude Desktop, VS Code GitHub Copilot, Goose, ChatGPT, Cursor 등에 MCP server를 등록할 수 있으며, 조사와 검증, 후속 조치를 IDE 밖으로 나가지 않고 이어갈 수 있습니다.
섹션별 상세



용어 해설
- Model Context Protocol
- — AI 에이전트가 외부 도구와 데이터를 호출하는 표준 프로토콜입니다. 에이전트는 JSON-RPC 요청으로 도구와 매개변수를 전달하고 서버의 결과를 추론에 사용합니다. MCP Apps는 기존 텍스트 응답에 IDE가 렌더링할 시각화 페이로드를 추가합니다.
- 에이전트 기반 옵저버빌리티(Agentic Observability)
- — AI 에이전트가 알림, 로그, Trace를 조회하고 서로 연관시켜 장애 원인 가설을 만드는 운영 방식입니다. 에이전트가 질의와 상관관계 분석을 대신하지만, 기존에는 사람이 별도 대시보드에서 결과를 다시 확인해야 했습니다.
- Trace 워터폴(Trace Waterfall)
- — 분산 Trace 안의 Span 계층과 각 작업의 시작 시점 및 지속 시간을 시간축으로 표시하는 시각화입니다. 장애가 어느 서비스와 Span에서 시작됐는지 확인하고 지연 구간을 좁히는 데 사용됩니다.
- 서비스 토폴로지(Service Topology)
- — 서비스 사이의 호출 관계를 의존성 그래프로 표현한 구조입니다. MCP Apps의 토폴로지 도구는 호출량과 오류율을 간선과 노드에 표시해 장애 영향 범위와 상류 호출자를 파악하도록 돕습니다.
- RED 메트릭(RED Metrics)
- — 서비스 성능을 Rate, Errors, Duration 세 지표로 보는 관측 방식입니다. 이 글에서는 서비스 성능 도구가 서비스 수준의 요청률, 오류, 처리 시간을 제공해 장애 영향과 성능 저하를 정량화하는 데 사용됩니다.
기술
- Amazon OpenSearch Service
- MCP Apps
- Model Context Protocol
- OpenSearch UI
- OpenSearch domains
- serverless collections
- Amazon Managed Service for Prometheus
- PromQL
- Node.js
- Claude Desktop
- VS Code GitHub Copilot
- Goose
- ChatGPT
- Cursor
- OpenTelemetry Demo
- AWS IAM
활용 사례
- 온콜 엔지니어가 오류 급증의 원인을 로그, Trace, 서비스 맵으로 조사하고 같은 IDE 대화에서 영향 범위를 검증하는 운영 장애 대응
- 로컬에서 실행하는 AI 기반 옵저버빌리티 환경에서 외부 브라우저 없이 Trace 워터폴과 서비스 토폴로지를 확인하는 검증 작업
- AI 워크플로를 구축하는 팀이 LLM 호출과 에이전트 Trace 맵을 조회해 자체 에이전트의 동작을 관찰하는 운영
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.