본문으로 건너뛰기

AI가 클라우드를 운영하려면 데이터부터 이해해야 합니다.

kt cloud가 Observability와 MCP Hub로 AI 기반 클라우드 운영 구조를 구축합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Cloud Native 환경에서는 하나의 요청이 여러 마이크로서비스와 인프라를 거치기 때문에 장애 알람만으로 실제 원인을 찾기 어렵고, 운영자가 여러 시스템의 데이터를 수동으로 연결해야 합니다. kt cloud는 OpenTelemetry를 기반으로 네트워크·인프라·플랫폼·애플리케이션의 Metric·Log·Trace를 하나의 흐름으로 묶고, 서비스·자원·리전·테넌트 맥락까지 데이터에 포함하려 합니다. AI Agent는 MCP Hub에 등록된 목적별 도구를 통해 운영 시스템에 접근하며, 사용자의 신원과 기존 권한 정책을 전달받고 호출 이력도 Observability 대상이 됩니다. Grafana LGTM과 OpenTelemetry를 바탕으로 Telemetry Gateway와 Siren을 자체 개발해 멀티테넌시와 확장성을 보완하고, 고객 데이터와 내부 운영 데이터를 별도 클러스터에 저장합니다. 최종적으로 AI가 장애 구간과 영향 범위, 과거 대응 이력을 먼저 정리하고 운영자는 실제 조치와 우선순위를 판단하는 지능형 클라우드 운영 모델을 구축하려는 방향입니다.

섹션별 상세

01
Cloud Native 환경에서는 컨테이너와 마이크로서비스가 수시로 변하고 하나의 요청도 여러 서비스와 인프라를 거치므로, 응답 지연이 발생한 지점과 실제 원인이 있는 지점이 달라질 수 있습니다. 기존 Monitoring은 CPU·메모리·디스크 같은 사전 정의 지표가 임계치를 넘었는지 알리는 데 초점이 있어, 운영자가 여러 대시보드와 담당자 사이에서 데이터를 다시 연결해야 했습니다. kt cloud는 Observability를 통해 문제가 드러난 구간에서 원인이 있는 구간까지 공통 데이터 흐름을 따라가도록 만들어 장애 분석을 담당자의 경험 중심 과정에서 연결된 데이터와 절차 중심 과정으로 바꾸려 합니다.
02
Metric·Log·Trace를 서로 다른 시스템에 따로 저장하면 이상 시점, 당시 발생한 이벤트, 전체 요청 경로를 각각 검색해야 하므로 원인 파악이 늦어집니다. kt cloud는 OpenTelemetry를 표준 수집 규격으로 활용하고 네트워크·인프라·플랫폼·애플리케이션 계층의 데이터를 함께 수집해 Metric에서 관련 Log로, 다시 해당 요청의 Trace로 이동하는 흐름을 구성합니다. 서비스·자원·리전·테넌트 레이블과 데이터 규격을 일관되게 관리하면 AI가 데이터 자체뿐 아니라 데이터가 속한 운영 맥락까지 활용할 수 있다는 점이 핵심입니다.
03
AI Agent를 운영 시스템에 개별 연결하면 시스템이 늘어날수록 연결 구조와 인증·권한 관리가 복잡해집니다. Data플랫폼팀은 그 사이에 MCP Hub를 두고, AI Agent가 데이터 저장소에 직접 접근하지 않고 특정 기간의 지표 조회나 특정 자원의 상태 확인처럼 목적이 정해진 도구를 선택해 호출하도록 구성했습니다. 도구의 범위를 운영자의 실제 질문 단위에 맞추면 호출을 과도하게 늘리지 않으면서도 AI가 필요한 운영 데이터를 안전한 경로로 조회할 수 있습니다.
04
AI가 운영 데이터와 도구에 접근하려면 요청한 사람이 누구인지, 무엇까지 볼 수 있는지, 요청이 어떻게 처리됐는지를 확인할 수 있어야 합니다. kt cloud는 MCP Hub를 통해 사용자의 신원을 각 운영 시스템으로 전달하고, 최종 접근 여부는 각 시스템의 기존 권한 정책이 판단하도록 하며 AI Agent의 도구 호출과 정보 흐름도 Observability Platform에 기록합니다. 이렇게 인증·인가와 활동 이력을 기존 운영 데이터와 함께 관리하면 AI 연결 이후에도 데이터 접근 경계와 감사 가능한 운영 흐름을 유지할 수 있습니다.
05
kt cloud는 Grafana LGTM과 OpenTelemetry 기반의 OSS 생태계를 사용하면서도 대규모 CSP 환경에 필요한 기능을 독립 컴포넌트로 구현했습니다. Telemetry Gateway는 고객별 관측 데이터를 테넌트 단위로 격리하고 적절한 클러스터로 연결하며, 데이터가 늘어나면 동일한 구조의 클러스터를 추가해 요청을 분산합니다. Siren은 알람·레이블·대시보드 연결 규격을 표준화하고, 오픈소스 소스코드를 직접 수정하지 않는 방식으로 OSS 업데이트와 자체 기능 개발을 함께 유지합니다.
06
고객 데이터와 kt cloud 내부 운영 데이터는 볼 수 있는 대상과 보호 기준이 다르므로 저장 단계부터 분리해야 합니다. kt cloud는 두 데이터를 서로 다른 클러스터에 저장하고, 고객 데이터 내부에서도 Telemetry Gateway가 프로젝트를 관측 데이터의 테넌트로 매핑해 고객별 데이터가 섞이지 않도록 구성했습니다. 권한 설정 오류가 데이터 노출로 이어질 가능성을 저장 계층의 구조적 경계로 줄이고, 공공 부문 클라우드 인증 요건과 향후 PLATFORM 서비스 확장에도 같은 격리 원칙을 적용할 기반을 마련합니다.
07
통합 데이터 플랫폼의 범위는 Metric·Log·Trace를 넘어 클라우드 자원, 고객, 비용, 매출까지 이어지며 운영 판단에 필요한 맥락을 넓히고 있습니다. 장애가 발생하면 AI Agent가 MCP Hub를 통해 데이터를 조회하고, AI가 이상 구간과 관련 서비스·자원·영향 범위를 정리하며 과거 장애와 대응 이력까지 연결해 필요한 조치를 제시하는 흐름을 지향합니다. 운영자는 여러 시스템에서 정보를 찾는 작업보다 AI가 정리한 상황을 바탕으로 실제 조치와 우선순위를 판단하는 데 집중하고, kt cloud는 내부 검증 경험을 고객용 지능형 운영 서비스로 확장할 계획입니다.

용어 해설

옵저버빌리티(Observability)
Observability는 Metric·Log·Trace처럼 시스템에서 발생하는 데이터를 연결해 서비스 상태뿐 아니라 장애의 원인과 맥락까지 추적하는 관측 체계입니다. 미리 정의한 임계치의 이상 여부만 감지하는 Monitoring과 달리, 예상하지 못한 문제의 발생 지점과 실제 원인이 있는 구간을 데이터 흐름으로 좁혀가는 데 의미가 있습니다.
AIOps
AIOps는 AI와 데이터 분석을 IT 운영에 적용해 장애 탐지·분석·대응과 운영자의 의사결정을 지원하는 방식입니다. 클라우드 운영 데이터가 서비스·자원·비용 같은 맥락과 연결되어야 AI가 단순 이상 감지를 넘어 영향 범위와 대응 방안을 판단하는 데 활용될 수 있습니다.
OpenTelemetry
OpenTelemetry는 Metric·Log·Trace 같은 텔레메트리 데이터를 생성·수집·전달하기 위한 오픈소스 관측 프레임워크입니다. kt cloud는 이를 표준 수집 규격으로 활용해 서로 다른 계층의 운영 데이터를 같은 흐름으로 연결하고, Metric에서 관련 Log와 Trace로 이동하는 분석 경로를 구성합니다.
MCP Hub
MCP Hub는 AI Agent와 클라우드 운영 시스템 사이에서 미리 정의한 도구를 통해 데이터와 기능에 접근하게 하는 공통 연결 계층입니다. AI Agent가 저장소에 직접 접근하는 대신 특정 기간의 지표 조회나 특정 자원의 상태 확인 같은 도구를 호출하도록 제한해 연결 구조와 접근 경로를 통제합니다.
Grafana LGTM
Grafana LGTM은 Loki(Log), Grafana(Visualization), Tempo(Trace), Mimir(Metric)를 중심으로 구성된 Observability 기술 스택입니다. kt cloud는 이 OSS 생태계와 OpenTelemetry를 바탕으로 하면서, CSP 환경에 필요한 멀티테넌시·권한 관리·확장성은 자체 컴포넌트로 보완합니다.

기술

  • kt cloud Observability Platform
  • OpenTelemetry
  • MCP Hub
  • AI Agent
  • Grafana LGTM
  • Loki
  • Grafana
  • Tempo
  • Mimir
  • Telemetry Gateway
  • Siren
  • Cloud Native
  • Metric
  • Log
  • Trace
  • CSP

활용 사례

  • Cloud Native 장애 원인 추적
  • Metric·Log·Trace 통합 분석
  • AI 기반 클라우드 운영 지원
  • 운영 데이터와 비용·매출 데이터의 통합 분석
  • 고객별 관측 데이터 격리
  • AI Agent의 운영 시스템 접근 통제
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 26.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.