TL;DR
Cloud Native 환경에서는 하나의 요청이 여러 마이크로서비스와 인프라를 거치기 때문에 장애 알람만으로 실제 원인을 찾기 어렵고, 운영자가 여러 시스템의 데이터를 수동으로 연결해야 합니다. kt cloud는 OpenTelemetry를 기반으로 네트워크·인프라·플랫폼·애플리케이션의 Metric·Log·Trace를 하나의 흐름으로 묶고, 서비스·자원·리전·테넌트 맥락까지 데이터에 포함하려 합니다. AI Agent는 MCP Hub에 등록된 목적별 도구를 통해 운영 시스템에 접근하며, 사용자의 신원과 기존 권한 정책을 전달받고 호출 이력도 Observability 대상이 됩니다. Grafana LGTM과 OpenTelemetry를 바탕으로 Telemetry Gateway와 Siren을 자체 개발해 멀티테넌시와 확장성을 보완하고, 고객 데이터와 내부 운영 데이터를 별도 클러스터에 저장합니다. 최종적으로 AI가 장애 구간과 영향 범위, 과거 대응 이력을 먼저 정리하고 운영자는 실제 조치와 우선순위를 판단하는 지능형 클라우드 운영 모델을 구축하려는 방향입니다.
섹션별 상세
용어 해설
- 옵저버빌리티(Observability)
- — Observability는 Metric·Log·Trace처럼 시스템에서 발생하는 데이터를 연결해 서비스 상태뿐 아니라 장애의 원인과 맥락까지 추적하는 관측 체계입니다. 미리 정의한 임계치의 이상 여부만 감지하는 Monitoring과 달리, 예상하지 못한 문제의 발생 지점과 실제 원인이 있는 구간을 데이터 흐름으로 좁혀가는 데 의미가 있습니다.
- AIOps
- — AIOps는 AI와 데이터 분석을 IT 운영에 적용해 장애 탐지·분석·대응과 운영자의 의사결정을 지원하는 방식입니다. 클라우드 운영 데이터가 서비스·자원·비용 같은 맥락과 연결되어야 AI가 단순 이상 감지를 넘어 영향 범위와 대응 방안을 판단하는 데 활용될 수 있습니다.
- OpenTelemetry
- — OpenTelemetry는 Metric·Log·Trace 같은 텔레메트리 데이터를 생성·수집·전달하기 위한 오픈소스 관측 프레임워크입니다. kt cloud는 이를 표준 수집 규격으로 활용해 서로 다른 계층의 운영 데이터를 같은 흐름으로 연결하고, Metric에서 관련 Log와 Trace로 이동하는 분석 경로를 구성합니다.
- MCP Hub
- — MCP Hub는 AI Agent와 클라우드 운영 시스템 사이에서 미리 정의한 도구를 통해 데이터와 기능에 접근하게 하는 공통 연결 계층입니다. AI Agent가 저장소에 직접 접근하는 대신 특정 기간의 지표 조회나 특정 자원의 상태 확인 같은 도구를 호출하도록 제한해 연결 구조와 접근 경로를 통제합니다.
- Grafana LGTM
- — Grafana LGTM은 Loki(Log), Grafana(Visualization), Tempo(Trace), Mimir(Metric)를 중심으로 구성된 Observability 기술 스택입니다. kt cloud는 이 OSS 생태계와 OpenTelemetry를 바탕으로 하면서, CSP 환경에 필요한 멀티테넌시·권한 관리·확장성은 자체 컴포넌트로 보완합니다.
기술
- kt cloud Observability Platform
- OpenTelemetry
- MCP Hub
- AI Agent
- Grafana LGTM
- Loki
- Grafana
- Tempo
- Mimir
- Telemetry Gateway
- Siren
- Cloud Native
- Metric
- Log
- Trace
- CSP
활용 사례
- Cloud Native 장애 원인 추적
- Metric·Log·Trace 통합 분석
- AI 기반 클라우드 운영 지원
- 운영 데이터와 비용·매출 데이터의 통합 분석
- 고객별 관측 데이터 격리
- AI Agent의 운영 시스템 접근 통제
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
