본문으로 건너뛰기

복합 AI 시스템을 위한 인프라 패턴

여러 모델과 도구가 연결된 복합 AI 시스템에는 모델별 확장, 병렬 호출, 연쇄 콜드 스타트 완화, 파이프라인 관측성이 필요합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

생성형 AI 애플리케이션은 단일 LLM Endpoint가 아니라 Retriever, Embedding 모델, Dialogue LLM, Classifier, Code Interpreter, SQL Executor가 연결된 복합 AI 시스템으로 운영되고 있습니다. 이 구조에서는 사용자 요청률이 아니라 모델별 호출률에 따라 확장해야 하며, 지연 시간이 다른 모델을 별도 배포 모드와 Queue 정책으로 분리해야 자원 경쟁을 줄일 수 있습니다. 모델 간 의존성은 콜드 스타트를 연쇄적으로 늘리므로 파이프라인 단위 사전 가동과 임계 경로 중심의 Provisioned Concurrency가 필요하고, 병렬 호출은 순차 대기 시간을 줄이는 핵심 조건입니다. ClearML의 GenAI App Engine은 여러 Serving Engine, Endpoint별 Autoscaling, Unified Memory, 모니터링과 접근 제어를 제공해 상위 Orchestration 계층 아래의 Inference Plane을 맡는다는 입장입니다.

섹션별 상세

01
단일 LLM과 단일 Endpoint를 중심으로 설계한 기존 GenAI 인프라는 검색, 생성, 분류, 코드 실행, SQL 실행을 한 요청 안에서 연결하는 복합 AI 시스템의 호출 구조를 반영하지 못합니다. Salesforce의 12개월 이상 운영 자료는 8,000명의 사용자 환경에서 하루 평균 722,000회, 업무량이 높은 날에는 140만 회의 LLM 추론이 발생했고 2026년 3월에만 1360억 Token을 처리했다고 기록했습니다. 이 규모에서 중요한 대상은 개별 모델이 아니라 여러 구성 요소가 연결된 전체 파이프라인이며, 인프라 역시 모델 제공 계층과 Orchestration 계층을 분리한 구조로 바뀌어야 합니다.
02
복합 AI 시스템의 Fan-out은 사용자 요청 하나를 여러 모델 호출로 확장하므로 모델마다 필요한 확장 비율이 달라집니다. Salesforce의 전형적인 에이전트 요청은 두세 개에서 네 개의 모델 호출로 나뉘며, Embedding 모델은 모든 요청에 실행되는 반면 Dialogue LLM은 70%, SQL Executor는 25%의 요청에만 호출됩니다. 10배 트래픽 증가 때 Embedding은 10배, Dialogue LLM은 6~7배, SQL Executor는 2~3배만 확장됐기 때문에 전체 요청률로 일괄 확장하면 SQL Executor를 3~5배 과잉 배치하면서 Embedding 용량은 부족하게 만들 수 있고, 모델별 호출률 기반 확장이 이 문제를 해결합니다.
03
구성 요소마다 지연 시간과 자원 사용 패턴이 달라 하나의 공유 Queue에 넣으면 빠른 경로가 느린 LLM에 막힐 수 있습니다. Embedding 모델의 응답 시간이 50밀리초여도 앞선 Queue에서 Dialogue LLM이 3~5초 동안 GPU를 점유하면 실제 요청은 수초를 기다리며, 모델 자체의 처리 속도가 아니라 공유 자원 경쟁이 병목이 됩니다. 따라서 높은 QPS와 엄격한 지연 조건의 Dialogue LLM은 Dedicated 용량에 두고, 빠르게 시작하는 고빈도 Embedding 모델은 Serverless로, 조건부 SQL Executor는 프로비저닝된 동시성 없이 운영하는 혼합 배치가 필요하며, Salesforce는 이 방식으로 순수 Serverless 또는 순수 Dedicated 구성보다 추론 비용을 15~20% 낮췄습니다.
04
콜드 스타트는 여러 모델이 동시에 켜지는 최대 시간으로 끝나지 않고 모델 간 의존성에 따라 연쇄적으로 늘어납니다. Embedding이 Context를 준비한 뒤 Dialogue LLM이 응답을 생성해야 하는 구조에서 Embedding 30초, Dialogue LLM 150초, Classifier 20초의 로딩 시간이 약 180초의 유효 지연으로 이어졌습니다. 파이프라인 단위의 사전 가동은 지연을 약 180초에서 약 65초로 65% 줄였고, 임계 경로 모델만 유지하는 Tiered Provisioned Concurrency는 전체 모델을 상시 유지하는 비용의 약 20%로 사용자 체감 콜드 스타트 지연을 약 70% 없앴으며, 트래픽 신호 기반 Predictive Warming은 Salesforce Agentforce의 피크 시간대 콜드 스타트를 90% 넘게 제거했습니다.
05
여러 모델 호출을 순차적으로 보내면 모델 수가 늘어날수록 대기 시간이 Interactive SLA를 압도하므로 Parallel Dispatch와 Event-Driven Orchestration이 선택 사항이 아니라 운영 조건이 됩니다. Salesforce 측정에서 병렬 호출의 Fan-out 오버헤드는 45~80밀리초로 전체 에이전트 응답 시간 5~8초의 2% 미만이었지만, 순차 호출은 1.5~3초의 추가 대기를 만들었습니다. Orchestration 계층은 호출을 동시에 시작하고 응답을 비동기로 모으며 개별 실패를 격리해야 하고, 추론 계층은 동시 요청이 서로의 Queue를 막지 않도록 지원해야 합니다.
06
복합 AI 인프라는 모델별 독립 확장, 트래픽 패턴에 따른 Dedicated·Serverless·Hybrid 배치, 병렬 호출과 Circuit Breaker를 갖춘 파이프라인 인식 Orchestration, 조정된 콜드 스타트 완화, 파이프라인 수준 관측성을 함께 갖춰야 합니다. ClearML의 GenAI App Engine은 vLLM, Triton, Llama.cpp를 통한 Multi-Engine Serving, Endpoint별 동적 트래픽 라우팅과 Autoscaling, 유휴 모델을 CPU 메모리에 유지하는 Unified Memory, CPU·GPU·I/O·Network 사용량 모니터링, RBAC와 인증을 제공한다고 설명합니다. 이 구조에서 App Engine은 개별 모델을 제공하고 확장하며 관측하는 Inference Plane을 맡고, DSPy·LangGraph·Custom Agent Runtime 같은 상위 계층은 파이프라인 로직과 병렬 호출을 맡는 분리된 운영 모델을 형성합니다.

용어 해설

복합 AI 시스템(Compound AI System)
하나의 사용자 요청을 여러 모델과 도구의 호출로 분해해 처리하는 애플리케이션 구조입니다. 검색용 Embedding 모델, 생성용 LLM, Classifier, Code Interpreter, SQL Executor 등이 Orchestration 계층에서 연결되며, 단일 모델보다 시스템 전체의 호출 흐름과 지연 시간을 관리하는 일이 중요합니다.
팬아웃(Fan-out)
하나의 입력 요청을 여러 하위 모델 호출로 동시에 확장하는 처리 방식입니다. 복합 AI 시스템에서는 사용자 요청 하나가 Embedding, 대화형 LLM, Classifier 등으로 나뉘므로, 전체 요청 수가 아니라 모델별 실제 호출 빈도에 맞춰 용량을 배분해야 과잉 프로비저닝과 자원 부족을 피할 수 있습니다.
콜드 스타트(Cold Start)
유휴 상태의 모델을 다시 실행하기 위해 가중치와 실행 환경을 로드하면서 발생하는 초기 지연입니다. 복합 AI 시스템에서는 모델 간 의존성 때문에 상류 모델이 끝난 뒤 하류 모델이 시작되는 연쇄가 생기며, 개별 모델의 최대 로딩 시간보다 긴 파이프라인 지연으로 이어질 수 있습니다.
서킷 브레이커(Circuit Breaker)
하위 구성 요소의 반복적인 실패가 전체 서비스로 전파되지 않도록 호출을 일시 차단하고 대체 경로 또는 제한된 응답으로 전환하는 장애 격리 패턴입니다. 복합 AI 시스템에서는 특정 모델이나 도구의 오류가 다른 호출을 연쇄적으로 막지 않도록 Orchestration 계층에 필요합니다.
파이프라인 수준 관측성(Pipeline-Level Observability)
개별 모델의 지연 시간과 오류율을 넘어 하나의 에이전트 응답이 여러 구성 요소에서 어떻게 만들어졌는지 추적하는 관측 방식입니다. 모델별 SLA를 충족해도 전체 에이전트 SLA가 깨질 수 있으므로, 호출별 지연을 합산하고 임계 경로의 병목을 찾는 상위 계층의 측정이 필요합니다.

기술

  • vLLM
  • Triton
  • Llama.cpp
  • Hugging Face
  • DSPy
  • LangGraph
  • ClearML GenAI App Engine
  • App Gateway
  • RBAC
  • Unified Memory

활용 사례

  • RAG 기반 Chatbot
  • Tool을 호출하는 AI Agent
  • Guardrail 모델을 포함한 Summarization Pipeline
  • 검색·생성·분류가 결합된 Enterprise AI 애플리케이션
  • SQL Executor와 Code Interpreter를 사용하는 Agent Workflow
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 26.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.